{"as_of":"2026-08-08T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fca289bbe97d7ccbc7841d69888cbd89bd9d43a94400a2763c44041fbab5799","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:36.509160Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:36.029822Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-07T14:16:36.029822Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.029822Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:cab5f75f6ecf8f35080aa7b3cd407949e77adf57b596fffaf9b5d62ca79d8d48","observation_id":"e54ca4a9-5f34-48a3-bb04-952e8cce4afc","resolution":{"observed_at":"2026-08-07T14:16:36.029822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-06T16:17:42.986386Z","title":"Toward Scientific Rea- soning in LLMs: Training from Expert Discussions via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13966","last_updated":"2025-09-01T20:28:13Z","snapshot_observed_at":"2026-08-07T22:58:24.256674Z","submitted_at":"2025-07-18T14:30:08Z","title":"Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:42.986386Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2507.13966"},"observation_digest":"sha256:0fc19e731e3c93c72b74a065858c71c12f2ef645fb0c089c979cbfd92e77845f","observation_id":"061e31b1-ba24-4b77-b94f-eef42f8dd929","resolution":{"observed_at":"2026-08-06T16:17:42.986386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:760fee98a726c252dd30035154f1d5e27089713bde1c558476b1541d5e402438","observation_id":"836537d0-3232-4b45-9326-727cb0c321c3","resolution":{"observed_at":"2026-05-16T21:48:34.403311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:efc03b2812ef8fb4c8eba6fa725dbefd549a018c9b01250fe30e2328f193e8a3","observation_id":"35dc85c7-1183-4668-ac4d-9ddacfbfa3d3","resolution":{"observed_at":"2026-05-09T04:30:11.969332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2606.16517","last_updated":"2026-06-30T13:49:08Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-15T10:19:49Z","title":"How Post-Training Shapes Biological Reasoning Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:31.110861Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2606.16517"},"observation_digest":"sha256:d87c0a4085a1b81efea0f0b16b8197bc00bb0710fdb456ec2e1dc4d194d49c0e","observation_id":"ca5363fa-0429-4cc9-82e4-98d5859b14cb","resolution":{"observed_at":"2026-07-01T07:55:31.065267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19501/citation-record","integrity":"/paper/2505.19501/integrity","json":"/paper/2505.19501/citation-record.json","paper":"/paper/2505.19501"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.499322Z","title":"https://groups","venue":null,"work_id":"dddafe02-b091-495a-a7f9-e50b227aeae9","year":null},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.587229Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0c43b6870224e02c3c443f3b8d88fad1029ffd035033cefb92960f50f4bb0d0e","observation_id":"afea2159-1a30-42ab-b491-9dbae7c6f438","resolution":{"observed_at":"2026-08-07T14:16:39.579019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03323","last_updated":"2019-06-20T20:41:58Z","snapshot_observed_at":"2026-07-06T07:44:16.974916Z","submitted_at":"2019-04-06T00:34:39Z","title":"Publicly Available Clinical BERT Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03323","snapshot_observed_at":"2026-08-07T14:16:32.630844Z","title":"Publicly available clinical bert embeddings","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.630844Z"},"links":{"cited_paper":"/paper/1904.03323","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:5f05b268c74646c3b74b0f50d2072ba0af90c7349c62ae1141f61db3a682157a","observation_id":"98928a95-ae8b-49ba-95c7-d9675e3662e6","resolution":{"observed_at":"2026-08-07T14:16:32.630844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10676","last_updated":"2019-09-10T18:10:35Z","snapshot_observed_at":"2026-08-07T22:56:16.858302Z","submitted_at":"2019-03-26T05:11:46Z","title":"SciBERT: A Pretrained Language Model for Scientific Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.10676","snapshot_observed_at":"2026-08-07T14:16:32.723398Z","title":"Scibert: A pretrained language model for scientific text","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.723398Z"},"links":{"cited_paper":"/paper/1903.10676","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:36d6cbdcdd60b2b3a3764aae4321ecd6d123d2f08907a985b581460784f6d972","observation_id":"ec5f7560-c4fe-4f4e-b909-30935d26a96c","resolution":{"observed_at":"2026-08-07T14:16:32.723398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01976","last_updated":"2024-10-18T06:52:17Z","snapshot_observed_at":"2026-08-01T08:03:39.698594Z","submitted_at":"2024-03-04T12:19:28Z","title":"SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01976","snapshot_observed_at":"2026-08-07T14:16:32.807425Z","title":"Sciassess: Benchmarking llm proficiency in scientific literature analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.807425Z"},"links":{"cited_paper":"/paper/2403.01976","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:2e5b86a26c374e12d01bb885db5c7137281b203f6ad1ee81558f3a39f007199c","observation_id":"95578303-0a4e-43f2-8890-0b52b5acb70c","resolution":{"observed_at":"2026-08-07T14:16:32.807425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T14:16:32.906989Z","title":"Maxmin-rlhf: Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.906989Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:eb99b7d60233a0af4cce1c541171e3f88c3108534732b245fefada5696989434","observation_id":"e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f","resolution":{"observed_at":"2026-08-07T14:16:32.906989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.306230Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"97f04a1e-b77c-4f04-8a41-4756854dce4e","year":2017},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.000519Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:6df1604bfb8f273e876a9c509fa6924a5fcaced844fcdcd177a9f8d7f9906b60","observation_id":"83a7ae87-6a9a-46b3-ac06-a3b7d5c2023c","resolution":{"observed_at":"2026-08-07T14:16:39.374637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:39.019320Z","title":"A 5′ utr language model for decoding untranslated regions of mrna and function predictions","venue":null,"work_id":"cb3d5793-8f94-4e3d-b927-37e27b40a517","year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.064419Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:63413ce6ab0f48a86acabc2221c7ee366c6ef1b2a22daca21fe22d53f6ece93a","observation_id":"75646ddd-da90-4e10-8468-4bf1706831ad","resolution":{"observed_at":"2026-08-07T14:16:39.099082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:16:33.136460Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.136460Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:8e480cbf76acae5f65263e35b80f32c757f9b91832963e5e9a718786aa8131f1","observation_id":"1918dbac-c09e-49cf-bc17-08613e799728","resolution":{"observed_at":"2026-08-07T14:16:33.136460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14495","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.529348Z","title":"Temporal consistency for llm reasoning process error identification","venue":null,"work_id":"e02b1f7b-92ed-428e-bc08-e55dc6a3d351","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.252728Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:e0087a215643439c39a8cc2e4be2e697b355208793de964042a5baf1846b5f9d","observation_id":"a7ef9dc2-1148-494b-bc6c-906cf4dcb15e","resolution":{"observed_at":"2026-08-07T14:16:37.578310Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12482","last_updated":"2024-05-23T06:29:00Z","snapshot_observed_at":"2026-08-06T22:01:47.412235Z","submitted_at":"2024-03-19T06:39:47Z","title":"Embodied LLM Agents Learn to Cooperate in Organized Teams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12482","snapshot_observed_at":"2026-08-07T14:16:33.324986Z","title":"Embodied llm agents learn to cooperate in organized teams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.324986Z"},"links":{"cited_paper":"/paper/2403.12482","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:02083a13345224847bea3536788bb9db10b013ee9bab4cc1beacb183a5ea107f","observation_id":"3ff156e0-1d28-4814-a7ca-3c65c51b2479","resolution":{"observed_at":"2026-08-07T14:16:33.324986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.880726Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations","venue":null,"work_id":"44ef7218-4f46-48dd-b899-52c19090c346","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.400906Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:9f2b2a6cae7c413e62a9ca8481723455f9996465a650843da88b3da58cb6eed1","observation_id":"64f9b7dc-1b6b-405d-833b-2162ea59247f","resolution":{"observed_at":"2026-08-07T14:16:38.936618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.723685Z","title":"Crispr-gpt: An llm agent for automated design of gene-editing experiments","venue":null,"work_id":"f667181e-b064-4639-a74d-6c24da23e092","year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.487464Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0b83c4e72ea98ef4601fc363a2657e54e47de2feffb42b3d80662e1e1437ae4f","observation_id":"24d7bf2b-47c5-4494-b0a8-a3bbcfec2ef8","resolution":{"observed_at":"2026-08-07T14:16:38.786177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T14:16:33.563390Z","title":"A survey on large language models for code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.563390Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0d844304f7e637e1b364804d966b11f7bb5f4df6247dc2e3902e016c8a9689ff","observation_id":"ac6f6e28-6b99-4c06-a28e-2d2507c3c7ea","resolution":{"observed_at":"2026-08-07T14:16:33.563390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.585263Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":"1ca55cfe-fcf3-4266-86e1-e1998a6e8274","year":2021},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.651898Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:adcba13688d29d12b7e51dfa9feb461d265400030cf10390613bed03be8a1473","observation_id":"d6eafb56-a2a7-4cfc-8e9c-54abbfa772b6","resolution":{"observed_at":"2026-08-07T14:16:38.645884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-07T14:16:33.769378Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.769378Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:1ef3269f52619ae22841bfb2ddeaa1f036783f2e78577105015d95c3c02f5b0c","observation_id":"f33a9524-a96c-4116-884a-000a202120a4","resolution":{"observed_at":"2026-08-07T14:16:33.769378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.431917Z","title":"Bioasq-qa: A manually curated corpus for biomedical question answering","venue":null,"work_id":"6d8edb6e-713c-46bd-8419-831551cfa4ff","year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.839083Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:1e04958d42740a6bb38efe004922d0374af67ef8698ec202d47e9c84b7ecf673","observation_id":"1cdd6523-8ddc-4899-b1e9-b1baf5e61344","resolution":{"observed_at":"2026-08-07T14:16:38.500172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T14:16:33.944484Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.944484Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:73d916d8da0512d49f55465ad1e50275377a460c9273c17abbf9f894d3c93620","observation_id":"b7fa524b-9938-4b67-87b6-074d9acbade0","resolution":{"observed_at":"2026-08-07T14:16:33.944484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T14:16:34.024067Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.024067Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:926080dfcdb6e2a004bae7d9fad82288497d0170a043ea4898fdc23e2bf1c6ce","observation_id":"2b06293d-b9af-4ed1-ae10-8ded4e7c4f18","resolution":{"observed_at":"2026-08-07T14:16:34.024067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10362","last_updated":"2024-07-17T17:28:36Z","snapshot_observed_at":"2026-08-06T06:16:43.714786Z","submitted_at":"2024-07-14T23:52:25Z","title":"LAB-Bench: Measuring Capabilities of Language Models for Biology Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10362","snapshot_observed_at":"2026-08-07T14:16:34.099327Z","title":"Lab-bench: Measuring capabilities of language models for biology research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.099327Z"},"links":{"cited_paper":"/paper/2407.10362","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0dd420240da9c2a63c7291f83b8f98e318d7374ba74a009b5422f86c0f2b053a","observation_id":"5a98f1ac-515c-4c98-8df5-36f402dc2723","resolution":{"observed_at":"2026-08-07T14:16:34.099327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:34.189406Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.189406Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:6c7e6a54e063b3b89532b54b4a7a5678c05d7dda9e2f9bf33ecfb54fd6f59986","observation_id":"77bbd0b2-17ea-4458-9a67-bf64eef549bc","resolution":{"observed_at":"2026-08-07T14:16:34.189406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01268","last_updated":"2024-04-01T17:45:15Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:45:15Z","title":"Mapping the Increasing Use of LLMs in Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01268","snapshot_observed_at":"2026-08-07T14:16:34.285798Z","title":"Mapping the increasing use of llms in scientific papers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.285798Z"},"links":{"cited_paper":"/paper/2404.01268","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:7e252751582fd50c6ae03f63c908a6373082e08c9283474683815bada021c486","observation_id":"e6a6037e-1978-4a79-95c8-48a164660ba6","resolution":{"observed_at":"2026-08-07T14:16:34.285798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:16:34.365003Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.365003Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d045b089f31da468754d68ee245ccfb0dcea3429a5aa5f1d101edd893fa72bbd","observation_id":"33172ea8-d605-4bde-a5d1-e304650e5cb8","resolution":{"observed_at":"2026-08-07T14:16:34.365003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.260821Z","title":"Biogpt: generative pre-trained transformer for biomedical text generation and mining","venue":null,"work_id":"1b0ff854-9f9e-420a-b199-14d704fa2a4c","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.436232Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:1e6838f04a84de0810f6946cd697396468f2aee8fd9a447eb134c2d424b6152d","observation_id":"f8694ac4-f500-4491-96bc-cfff4e84cfcf","resolution":{"observed_at":"2026-08-07T14:16:38.339770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09442","last_updated":"2023-08-21T07:49:37Z","snapshot_observed_at":"2026-07-06T16:07:37.940200Z","submitted_at":"2023-08-18T10:14:35Z","title":"BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09442","snapshot_observed_at":"2026-08-07T14:16:34.525450Z","title":"Biomedgpt: Open multimodal generative pre-trained transformer for biomedicine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.525450Z"},"links":{"cited_paper":"/paper/2308.09442","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:ccf64c77cc27726e604e5b2727f9b99fe07e2314064b2cc55e04b11c5f390c8d","observation_id":"61c29d7e-f8ba-48c3-9696-7523461a9b8a","resolution":{"observed_at":"2026-08-07T14:16:34.525450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:38.107352Z","title":"Covid-qa: A question answering dataset for covid-19","venue":null,"work_id":"ce51074c-3929-49ee-bcfc-ca6c1d7cf4ea","year":2020},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.619750Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:45a8708968b271f68a84751e1fe863f0507270cbabab1f007849ccfd2bdba106","observation_id":"6a9d5b13-ca7d-4bd3-86df-09cefabe942b","resolution":{"observed_at":"2026-08-07T14:16:38.178198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.973246Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"b33fda37-fc31-49b2-859f-7d7169ba4f65","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.712194Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:f3fabb9e71f79d64378d6fcc1692dddca4792419036eb7a315e3fc40116796c0","observation_id":"212554fe-81aa-4ae6-826e-3be54a7976f7","resolution":{"observed_at":"2026-08-07T14:16:38.027226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:34.770907Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.770907Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d6d479998cf4e36414fa3fd50bd124a4f1f1a041fc85c3fee450b47c8319fbc9","observation_id":"ec343161-45bc-43cb-ba87-66f2b60092bd","resolution":{"observed_at":"2026-08-07T14:16:34.770907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:37.823318Z","title":"A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research","venue":null,"work_id":"9bab4c9c-21de-4cc4-81ca-dcfecf631743","year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.829896Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:a8731f7f4ad89d8157f3544b3cc14050b1dc85150d094d5bb3a57c755e2175a8","observation_id":"77d25e6f-a006-435a-be4b-15f8fd6de7a2","resolution":{"observed_at":"2026-08-07T14:16:37.871064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T14:16:34.919303Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:34.919303Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:f9ed9183b9386538f6a17b4ac2b17d57ebd8822ee815517d6a7e3acf838a906d","observation_id":"1153b7b9-16d3-4381-8ba0-ecd68bac0d78","resolution":{"observed_at":"2026-08-07T14:16:34.919303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03598","last_updated":"2021-05-28T06:09:23Z","snapshot_observed_at":"2026-08-04T08:32:19.594748Z","submitted_at":"2021-05-28T06:09:23Z","title":"SciFive: a text-to-text transformer model for biomedical literature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03598","snapshot_observed_at":"2026-08-07T14:16:35.015805Z","title":"Scifive: a text-to-text transformer model for biomedical literature","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.015805Z"},"links":{"cited_paper":"/paper/2106.03598","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:0bf5be213b59363c051a5581bd9f287e1e69b82c6b9bf9a8cf78eb8ef51f95ed","observation_id":"c6f1273f-6232-412d-8f21-579df929b853","resolution":{"observed_at":"2026-08-07T14:16:35.015805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17604","last_updated":"2025-04-22T20:31:48Z","snapshot_observed_at":"2026-08-07T16:44:44.662939Z","submitted_at":"2025-03-22T01:18:59Z","title":"OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17604","snapshot_observed_at":"2026-08-07T14:16:35.092269Z","title":"Omniscience: A domain-specialized llm for scientific reasoning and discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.092269Z"},"links":{"cited_paper":"/paper/2503.17604","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:89d0870a516b16d8ec496a0325ea181f53e0b10eef62e784156ebb026d6fbcbb","observation_id":"398dcbeb-5310-4dbe-bf77-71a92d4be9d6","resolution":{"observed_at":"2026-08-07T14:16:35.092269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.171091Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.171091Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:ba272637ad2a1a9abd52aca8776dfe65a9b20127738af0c9d5ded00dc06f436f","observation_id":"01f58c65-b194-47b9-bdd7-73f99773a326","resolution":{"observed_at":"2026-08-07T14:16:35.171091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:16:35.239501Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.239501Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:86e86f7e0b932ac3b07d0363b9396e425f975619d683d2c182ca580721762e7b","observation_id":"f1dbd3a9-b21d-4d71-ab50-a65683f5700f","resolution":{"observed_at":"2026-08-07T14:16:35.239501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:16:35.320838Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.320838Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:44fe4dffdfdf2738e7617a18f51f25adba3d969930d8762134711d9e4a84b0b3","observation_id":"53a1d2b6-08e4-4829-8fe3-83f970070603","resolution":{"observed_at":"2026-08-07T14:16:35.320838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.377873Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.377873Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d79ae381d02c2ade6bfa3fbb1c57e6403c13fee8d90eb92518977a110970a79b","observation_id":"d0279c49-b79e-457c-9f38-f64049913834","resolution":{"observed_at":"2026-08-07T14:16:35.377873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T14:16:35.431025Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.431025Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:ec10e0acf981cd4e08cb87788642b9a3985b31257e996c7d1b4cfc1fdf4170b3","observation_id":"e2d81dc0-19e9-4631-953a-61b9f0b2d066","resolution":{"observed_at":"2026-08-07T14:16:35.431025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-07T14:16:35.497267Z","title":"Galactica: A large language model for science","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.497267Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:991c2f6081b2c1eb33e98d54880cd28c4f28fd8d7637f289761da2393bcf130a","observation_id":"11ccb532-811a-4fa2-a7c2-9f49545af144","resolution":{"observed_at":"2026-08-07T14:16:35.497267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.578517Z","title":"A call for built-in biosecurity safeguards for generative ai tools","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.578517Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4ab83070eeb61513c10a22c2f0f80e93582e78f37388b16ebf015cb9365567ce","observation_id":"00e70ae3-52f4-48ff-9b2c-d3a0eb1a415b","resolution":{"observed_at":"2026-08-07T14:16:35.578517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:35.641355Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.641355Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:cebec2a88c9cc4b270b9c72cc9a55d47f297a3a69c88103c2169986e98241776","observation_id":"5a8f5076-31cb-4081-a8a1-dd64cc10cea3","resolution":{"observed_at":"2026-08-07T14:16:35.641355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00212","last_updated":"2023-10-10T02:32:08Z","snapshot_observed_at":"2026-07-06T16:25:50.576054Z","submitted_at":"2023-09-30T01:23:22Z","title":"Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00212","snapshot_observed_at":"2026-08-07T14:16:35.711109Z","title":"Pairwise proximal policy optimization: Harnessing relative feedback for llm alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.711109Z"},"links":{"cited_paper":"/paper/2310.00212","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d2f1d8cbdb953ee28a2d699484a059a92005a3acb489eb8c0282def897bdf74e","observation_id":"7f645668-9c8f-4882-b23b-0fe5ee70045a","resolution":{"observed_at":"2026-08-07T14:16:35.711109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13565","last_updated":"2023-08-25T01:40:48Z","snapshot_observed_at":"2026-08-07T20:49:10.487073Z","submitted_at":"2023-08-25T01:40:48Z","title":"DARWIN Series: Domain Specific Large Language Models for Natural Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13565","snapshot_observed_at":"2026-08-07T14:16:35.778875Z","title":"Darwin series: Domain specific large language models for natural science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.778875Z"},"links":{"cited_paper":"/paper/2308.13565","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:d23a05c27ae8774a11a69ab24e77552961a00576988220acd4687305a3dcc1c4","observation_id":"b5447346-bd0c-432b-8df5-a6d32676b0b1","resolution":{"observed_at":"2026-08-07T14:16:35.778875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T14:16:35.860086Z","title":"A minimalist approach to llm reasoning: From rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.860086Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:b94750cfef7a5425997f3668ea4709acfff7abdfba8dfdf7d62587f6c2b12392","observation_id":"bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92","resolution":{"observed_at":"2026-08-07T14:16:35.860086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-07T14:16:35.917247Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.917247Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:337847abf97f66f059d556fc9248636cdbcdbb5b2151d246e787865b47160e83","observation_id":"bc33c128-912a-46f2-b9d8-2183cc8c76cf","resolution":{"observed_at":"2026-08-07T14:16:35.917247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03540","last_updated":"2022-12-16T22:20:33Z","snapshot_observed_at":"2026-07-06T12:45:10.731233Z","submitted_at":"2022-02-02T14:28:51Z","title":"GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03540","snapshot_observed_at":"2026-08-07T14:16:35.973838Z","title":"Smith, Christopher Parisien, Colin Compas, Cheryl Martin, Mona G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.973838Z"},"links":{"cited_paper":"/paper/2203.03540","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:6e378a3fa191d0475646b2f128ebf4eadc81526c26e54c66fa298f64a21562ff","observation_id":"092e32ff-81b6-4a4c-b27c-8426ce22c4ec","resolution":{"observed_at":"2026-08-07T14:16:35.973838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-07T14:16:36.029822Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.029822Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:cab5f75f6ecf8f35080aa7b3cd407949e77adf57b596fffaf9b5d62ca79d8d48","observation_id":"e54ca4a9-5f34-48a3-bb04-952e8cce4afc","resolution":{"observed_at":"2026-08-07T14:16:36.029822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:16:36.086883Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.086883Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:aa3eb0d86defcb1c0dc1ae9650c37ecd558c5ad2f9d9f73bc006f8724472d223","observation_id":"a53ce49d-145b-4e6a-ac43-cc76e727053d","resolution":{"observed_at":"2026-08-07T14:16:36.086883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03905","last_updated":"2022-04-22T07:47:42Z","snapshot_observed_at":"2026-07-06T12:58:09.665774Z","submitted_at":"2022-04-08T08:07:42Z","title":"BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model","version":2},"cited_work":{"arxiv_id":"2204.03905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03905","snapshot_observed_at":"2026-08-07T14:16:36.692059Z","title":"BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model","venue":"cs.CL","work_id":"d6a04b42-6dbd-4b2f-a3d7-4f806d094e23","year":2022},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.154616Z"},"links":{"cited_paper":"/paper/2204.03905","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:e327de753b70a8315b9c1bdf64c13213d05c8e4077b1fc9dc6611caa62ea02cd","observation_id":"82e82881-5bed-4ba4-b91c-2b451aba0c5c","resolution":{"observed_at":"2026-08-07T14:16:36.808890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:36.214381Z","title":"A generalist vision–language foundation model for diverse biomedical tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.214381Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:7762066e014dc6bfd0ff7ed4402f881766e47a8dbe8c6d61b4b599dc42b78e07","observation_id":"2c79a4eb-c102-4f33-bc36-b20ffc301b21","resolution":{"observed_at":"2026-08-07T14:16:36.214381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:36.302753Z","title":"Scientific large language models: A survey on biological & chemical domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.302753Z"},"links":{"citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:435ddec7fcc33f6c4332822974d00cb7dbf2e20c54827a4f72d233332adb6bcf","observation_id":"f38840b1-f1c2-48c1-a399-4e3266f637bd","resolution":{"observed_at":"2026-08-07T14:16:36.302753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:16:36.509160Z","title":"Genome Engineering using CRISPR/- Cas Systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.509160Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:78af7669d6567ee08978f7109babbf8ced673c6013c2b84487febeadc85aee6f","observation_id":"d3bbb883-9740-4886-bf2b-91166959f7c4","resolution":{"observed_at":"2026-08-07T14:16:36.509160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.19501."}