{"as_of":"2026-08-23T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46bbcdf9e9050f41951034df7886685499a328d27aa8a4dd09e2df47ace2b54e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T15:50:01.064709Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T01:16:50.927415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15341","snapshot_observed_at":"2026-07-12T01:16:50.927415Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03601","last_updated":"2026-07-03T20:58:29Z","snapshot_observed_at":"2026-08-19T18:15:18.632579Z","submitted_at":"2026-07-03T20:58:29Z","title":"ArchEval: Measuring AI Agents as Computer Architects","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T01:16:50.927415Z"},"links":{"cited_paper":"/paper/2605.15341","citing_paper":"/paper/2607.03601"},"observation_digest":"sha256:e8add7928e1ab260d722dc6e71f704c491b8555d0150c49a1a3cc1b647eca502","observation_id":"220371d5-9ce2-4ba8-868b-da4c7c863555","resolution":{"observed_at":"2026-07-12T01:16:50.927415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.15341/citation-record","integrity":"/paper/2605.15341/integrity","json":"/paper/2605.15341/citation-record.json","paper":"/paper/2605.15341"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez","venue":null,"work_id":"63d625c0-7504-4977-9aed-18426f9bb4d2","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:3eb63101cd082f7343b2665d43071a880caebab051bac063463c190a1f1ee019","observation_id":"b5cf1daf-ba07-4fe6-88c1-0bd3449b9607","resolution":{"observed_at":"2026-05-19T15:52:39.013931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-023-06792-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.566982Z","title":"Autonomous chemical research with large language models","venue":"Nature","work_id":"e15cebd6-c137-47c6-975e-41b70ed20de9","year":2023},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:95413a6724bc935a57998b08515b8c2d0b24b9ae6a7bfdb458c7457dae002733","observation_id":"e631a623-c8ed-47e4-8268-51ee34bb6aa5","resolution":{"observed_at":"2026-05-19T15:52:37.969723Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:19:55.682853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:19:55.682853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-08-17T05:38:14.090895Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":"1911.01547","doi":"10.1007/s11432-024-4231-5","metadata_source":"pith","pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Measure of Intelligence","venue":"cs.AI","work_id":"d8980a59-aa48-447b-8852-b7aca2b41b2c","year":2019},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:819b463a5a95234e54944fdbf75fb35b29ec065999b16b6998a3ed048a033061","observation_id":"269297ba-250e-419b-8736-9973f737c78f","resolution":{"observed_at":"2026-05-19T15:52:38.080243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":"2502.18864","doi":"10.3917/res.232.0099","metadata_source":"pith","pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards an AI co-scientist","venue":"cs.AI","work_id":"485486b1-a1a2-4cde-bdda-768930c403e6","year":2025},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:2ec64a1537b2c908f600f9741fdec5b0ee11a45e0a4ae9cf3b720f3762a88b5f","observation_id":"651285ec-1fe0-4e4b-9cc6-6f64dde5da37","resolution":{"observed_at":"2026-05-19T15:52:38.089188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ideabench: Benchmarking large language models for research idea generation","venue":null,"work_id":"046c9779-f697-4bc1-935f-dfb9765d93d6","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:9e428618409d80ac396ceaf44009d7d2fcf4a0c05174920fc1365fe5df24e223","observation_id":"60020a3d-142f-4cbe-82ff-c3a849976384","resolution":{"observed_at":"2026-05-19T15:52:39.004715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1896.373741","doi":"10.1145/3711896.3737417","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BurstGPT: A real-world workload dataset to optimize LLM serving systems","venue":null,"work_id":"f8d8d362-841a-46f1-9a17-7cf3545abc39","year":2025},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:41ad221db666bad1e866e987eca84107f6684facf532e723cb38a5527ae1ba30","observation_id":"77e0de7a-30d0-4f0e-b4b2-233d509d1c14","resolution":{"observed_at":"2026-05-19T15:52:37.960886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10362","last_updated":"2024-07-17T17:28:36Z","snapshot_observed_at":"2026-08-14T18:51:32.041872Z","submitted_at":"2024-07-14T23:52:25Z","title":"LAB-Bench: Measuring Capabilities of Language Models for Biology Research","version":3},"cited_work":{"arxiv_id":"2407.10362","doi":"10.1038/s41467-020-20383-x","metadata_source":"pith","pith_arxiv_id":"2407.10362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAB-Bench: Measuring Capabilities of Language Models for Biology Research","venue":"cs.AI","work_id":"37c8ae9b-ff00-4fa0-9c5c-8b3c255352ff","year":2024},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/2407.10362","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:ae6f35c98c6cd14170d92cc0ee9bd408f42271d75a26a2ed19fcc67990d4d58b","observation_id":"f0908c49-759b-44bc-9412-464948262429","resolution":{"observed_at":"2026-05-19T15:52:38.083379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21248","last_updated":"2026-04-20T16:53:43Z","snapshot_observed_at":"2026-07-06T20:59:31.273397Z","submitted_at":"2025-03-27T08:09:15Z","title":"ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition","version":3},"cited_work":{"arxiv_id":"2503.21248","doi":"10.48550/arxiv.2503.21248","metadata_source":"pith","pith_arxiv_id":"2503.21248","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition","venue":"cs.CL","work_id":"f9ffa616-6934-4c6d-98bd-888acc000aaa","year":2025},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/2503.21248","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:bfb3b9642d174b8a45e1b01aa5db92a95a697508de56daa15540e4ca47358400","observation_id":"221c4c7c-b92b-4040-b84f-f23b649768d4","resolution":{"observed_at":"2026-05-19T15:52:38.068813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A framework for evaluating the chemical knowledge and reasoning abilities of large language models against the expertise of chemists.Nature Chemistry","venue":null,"work_id":"2ae34258-af10-42c9-a074-80a012fb5b2b","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:e35b9b774742199688c85863b8af3bee4563c71436cc6ff20da3ba90d5ed2604","observation_id":"0a6921a4-010e-4a87-9dec-fba740d5baaa","resolution":{"observed_at":"2026-05-19T15:52:38.961604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.00096","doi":"10.48550/arxiv.2503.00096","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P","venue":"arXiv (Cornell University)","work_id":"2087a6ab-f9bd-47ad-a369-36820e1a8a5e","year":2025},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:88ba1a26c0421daa5ef72434d90f9beeb5df9153dfebc6241492110fa8f054ec","observation_id":"4455a4df-0ea0-4926-bf7f-f6f2bb1f71fd","resolution":{"observed_at":"2026-05-19T15:52:38.075556Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5334/jopd.139","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Journal of Open Psychology Data , author =","venue":"Journal of Open Psychology Data","work_id":"0e6b58e1-f025-4f5d-b5d0-63f364c50708","year":null},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:5461d7e553af9ced4f92307ad30ed9b8e9ba1517418365d86395125fcbc838b1","observation_id":"c3b4dfc1-d676-44b8-9b68-6a027b65d602","resolution":{"observed_at":"2026-05-19T15:52:37.962911Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:40.811221+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:40.811221+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design, or: How i learned to start worrying about prompt formatting","venue":null,"work_id":"b9cb9216-5533-4332-8958-0d23e3f090be","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:0c16ab4e0504f1917b285a35834f42e7f0cc4f92c4f3e9a9617febdaedf53d47","observation_id":"ddd4b8dd-6b70-458c-a819-e05b7575915e","resolution":{"observed_at":"2026-05-19T15:52:38.967808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:3085ad39d7bc5d61c57ca821fbd1bc0606d281a4a596aebd7f315bc27d6c5279","observation_id":"7a375841-1d3c-4874-9943-8543ce926562","resolution":{"observed_at":"2026-05-19T15:52:38.086290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64898/2026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:49:03.417849Z","title":"McConnell Rooney, M","venue":null,"work_id":"9d7e2eac-696b-4ab7-9b1f-7bc289499542","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:c013b2d859a8fd0c55690be696925863e9b0478b0042a25c1dea6e431c42d7b2","observation_id":"96707ca3-2673-4e7d-be44-270da38de506","resolution":{"observed_at":"2026-05-19T15:52:37.967345Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:0ec50575a171ff4636d5b8ce87565fdd3ace3725327a41be4ae26b88b8abb48f","observation_id":"fb733375-8091-49ae-b246-0ba0c42c5cf7","resolution":{"observed_at":"2026-05-19T15:52:38.071639Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loomba, Shichang Zhang, Yizhou Sun, and Wei Wang","venue":null,"work_id":"22b939d5-f23e-46eb-b324-68302e4797c6","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:f0fe1b8e630c921bad767768b4a490c123b656467fdd3e87fe6f973a95a75634","observation_id":"3c590227-1b47-4efa-bf25-fe5d64cd14d9","resolution":{"observed_at":"2026-05-19T15:52:39.017783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning or reciting? exploring the capabilities and limitations of language models through counterfactual tasks","venue":null,"work_id":"415897a5-e5d8-472f-bd7f-f09625486794","year":2024},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:68c8d7e91a09bd102113cb2cbf0d723be9b8532adad843f22aee42e6878237eb","observation_id":"fd5f72ee-db10-4a12-b720-b7da73af6b89","resolution":{"observed_at":"2026-05-19T15:52:39.008664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s13068-018-1068-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chujie Zheng, Zhenru Zhang, Beichen Zhang, Runji Lin, Keming Lu, Bowen Yu, Dayiheng Liu, Jingren Zhou, and Junyang Lin","venue":"Biotechnology for Biofuels","work_id":"566df222-9e1e-4637-9504-a5fa78c2c574","year":null},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:f518bb75ea100127c0a263b2c2a2b8517fb8d925087c0dc739a90bb05e05f189","observation_id":"8188bd6c-ad1b-44fd-9b47-fd4cf14f668e","resolution":{"observed_at":"2026-05-19T15:52:37.971766Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:41.299083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:41.299083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"rank-2, 50%)","venue":null,"work_id":"d59c1ef5-d712-411f-8970-7f4a05e1d7cf","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:9c0aefae13106e5222b79103a1a72429c7fc00d369c17bff0d7fa75dfa6c2978","observation_id":"244412da-2759-48b4-8b3b-deecc4444c45","resolution":{"observed_at":"2026-05-19T15:52:39.001109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3889fadb-4a8d-4cb2-87b9-cb8d78822ee2","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:52643ff92e0cc09672fd1df3d4909baa0e6a933e8c1d36033f677fd6dd84ddf2","observation_id":"568380db-c8d6-437e-a0ea-009232258018","resolution":{"observed_at":"2026-05-19T15:52:39.002833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.114564","doi":"10.1016/j.jviromet.2022.114564","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"You are optimizing CRISPR HDR efficiency","venue":"Journal of Virological Methods","work_id":"7da21aca-d16f-4b74-8989-d7bcba3e4578","year":2022},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:3f0da9ac77a6905cfec81852440039b66f28a99f4950c6ee31efac5864c7fbff","observation_id":"bd4eff59-07d9-4195-80b5-acc2fd6b458a","resolution":{"observed_at":"2026-05-19T15:52:37.957631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:41.791009+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:41.791009+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"no model clears 50%","venue":null,"work_id":"422c0a63-6384-40f3-92ee-0fc049230929","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:25761f6232449ab573c2e0dabf496f98eae6f8d5ba6525df9b5e8bf1393ffdaf","observation_id":"10c2a073-92eb-4340-8691-877eeaf00b1e","resolution":{"observed_at":"2026-05-19T15:52:39.006745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task-clustered 95% CIs shown","venue":null,"work_id":"c7b75324-f2e4-4a72-be92-81585b7c9d94","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:0bc254b0db3b839d93f5dd61ee8e9ba275d7bd982676f0b3895020edb72e1748","observation_id":"bf6af465-1330-42cc-9510-e96c6c9f4b76","resolution":{"observed_at":"2026-05-19T15:52:39.012193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error bars are task-clustered bootstrap 95% CIs (𝐵=2000)","venue":null,"work_id":"853eb0e0-9a19-4807-b483-2edc3ef575a6","year":2000},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:64a6f2a9adb546bff416dab018c2c0d3ad232027088ed38227b108a97ad34900","observation_id":"e8f92d74-ef9c-4fa0-a83c-6c268a324c23","resolution":{"observed_at":"2026-05-19T15:52:39.010438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GP-UCB, across horizons.Each model is ranked by the fraction of 45 biology tasks where its median bsf-AUC@𝑘 outperforms GP-UCB","venue":null,"work_id":"5c7a39f0-48e5-4a3c-ad48-b6777fa26d43","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:1eae21444fb79f4c21af6451a953fdb606a2ade8a8a0a386ad433a3381e0b653","observation_id":"d62e5ed4-d65d-4a05-a940-6132584f5404","resolution":{"observed_at":"2026-05-19T15:52:39.015969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error bars are task-clustered bootstrap 95% CIs (𝐵= 2000)","venue":null,"work_id":"989112d0-fc3d-4b17-8552-7786b539986b","year":2000},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:6c7147a764d0c9e069f82060fd2dbc2b6e0d7a4b92afa4e8d6af770f599a3e91","observation_id":"a02cde04-87ef-4fa5-9f29-fab0766f1a0e","resolution":{"observed_at":"2026-05-19T15:52:38.997609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"known-good","venue":null,"work_id":"c8c4733e-65ed-4e1c-8db9-3a58570963e1","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:5c0042f51bd611a3bc5076813ff01e633ea6598e15f7f4ba04a9a313c68c6a7e","observation_id":"68bcc7b3-c85f-4de1-8d33-f843a07bed8d","resolution":{"observed_at":"2026-05-19T15:52:38.999342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A.15 Robustness of Figure 4: alignment, match definition, and inferential tests This appendix gives the full robustness battery for the oracle-aligned match-rate finding in §4.3","venue":null,"work_id":"50e948fd-b4d4-43eb-91ef-4d11801fe4ff","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:45e9a0a78dd52d58619e6d373bce8c1f6c03dc4061bc3d627d8052b3efe3a67f","observation_id":"e161c94b-b99f-46fb-90df-38db291771b3","resolution":{"observed_at":"2026-05-19T15:52:38.993657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"35fb63e2-6a60-4b7b-9391-cba0738a9ea0","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:7e30a87f4d72cd4bc830b6356fa28d20893bce67ed24ee37dfe59b70a78031a1","observation_id":"493bdb43-fdf3-4258-bb49-ab121992058e","resolution":{"observed_at":"2026-05-19T15:52:38.991676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"domain-aware’s prior matches the RCT-confirmed mechanism","venue":null,"work_id":"94a671c1-488b-4789-b09f-452c6466cf74","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:305d29823d796f88491c6f5427a8ff58dde3d19dc628d539c9903867c1d68871","observation_id":"21760784-1ab0-492c-9988-38325e2d6c39","resolution":{"observed_at":"2026-05-19T15:52:38.995696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A.17 Threshold sensitivity of the audit’s main result The audit selects 6 literature-divergent biology tasks using two gap criteria connected by an OR: (R)top-1 vs","venue":null,"work_id":"eec8590d-4ecf-47d3-8e39-0be1b3efc99a","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:0a1ce584e047a3b80d099e1320be4e94178b7b2c856cdca5d6b88712dfe02f59","observation_id":"f8bedd77-a901-4d1c-ba1b-7db44488141b","resolution":{"observed_at":"2026-05-19T15:52:38.986533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"literature-typical and best-result diverge by a meaningful margin","venue":null,"work_id":"5457ee43-db22-4de4-a7e6-ab7dbd9e6466","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:a49fa55bc40ef5ffa311229599585e18c7210e6292073963b08267e977daed39","observation_id":"27dfe25f-6af0-4c3b-a7f8-63fb2735d900","resolution":{"observed_at":"2026-05-19T15:52:38.984285Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"domain-agnostic minus domain-aware","venue":null,"work_id":"3b370afe-5caf-4a05-b46f-abe2144b1d32","year":2018},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:959c7b8531f964c776b3a5aa529840f967740b128d0a3283a563ccf8e214fc59","observation_id":"a7040760-9283-4b7d-b45c-54bf6e4ae5c0","resolution":{"observed_at":"2026-05-19T15:52:38.980650Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e62fc7f-c28e-4227-ae0a-53c5826ee9da","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:7c74d9b5634cb260b945a8e3d9b9d5a68ced5795a960baef9ede2515bce138d6","observation_id":"d41a908a-0de6-4e8c-b05f-e21a9c50be38","resolution":{"observed_at":"2026-05-19T15:52:38.982469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"419445f7-20b0-4bc4-abef-c18a03f85c59","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:8c08edebd2e58c44444254fc9a82175af1f85432c754968e09d5c21f8ae9051f","observation_id":"f5562413-fe58-412f-af88-0900c28d764c","resolution":{"observed_at":"2026-05-19T15:52:38.988269Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b51b9f27-795e-4557-a48e-cb0f03526981","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:aa693aa14a147399bf8c4627fe64932e3dcc26d00f1cc83597d009470e968cf6","observation_id":"c52728a9-8f27-4904-9fc3-2dd0e883dc42","resolution":{"observed_at":"2026-05-19T15:52:38.975338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bottom row: domain-agnostic","venue":null,"work_id":"18ae6a2d-ed15-42df-bf1d-5147304d8da8","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:e593c6efe8abbba71f04ac001f0a45c2fecdff6958b640eaaadc2bfaa08c1a65","observation_id":"dc820085-b111-4363-8a25-63d694055bf3","resolution":{"observed_at":"2026-05-19T15:52:38.978869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GP-UCB on biology under thedomain-agnosticcondition","venue":null,"work_id":"4d66619c-9a66-4e07-a897-5739c20eb27b","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:1a9ab3f3c3ace245b09ee570332f6cf292c315997b5c86310464ebc5d2f51c3c","observation_id":"8ee2c146-d29d-45df-a3a2-c8300bd4833a","resolution":{"observed_at":"2026-05-19T15:52:38.977127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"fall back to common options","venue":null,"work_id":"e1a4ed89-f13f-44d8-86a6-279f5f5108b9","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:9b9e233483d44bfd032b711e1b06e5ae5819be418ba62ef66246d7bd9c473c76","observation_id":"b131d0ea-b6cc-451a-b092-266acad0f02c","resolution":{"observed_at":"2026-05-19T15:52:38.989983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11251-017-9403-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Oracle models are derived predictors trained on these data, released alongside the benchmark for reproducibility","venue":"Instructional Science","work_id":"c68035cf-b21a-47bb-9a79-f8a5b6afebec","year":2022},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:743f3861f60e230cfe6d3a648d05e91c2100874be061f2279ec2eed573f3d03c","observation_id":"76a29c78-051a-4d53-838a-05832fbd1800","resolution":{"observed_at":"2026-05-19T15:52:37.965048Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-24T13:53:42.33182+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T13:53:42.33182+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offline GRPO with KL penalty 𝛽=0.1, group size 8, learning rate 5 × 10−6, 2 epochs over the fixed trajectory pool","venue":null,"work_id":"54d67f86-32cf-4888-a661-57c3b354b348","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:ec672121efc4001f1a747903044b46f92fafba57b268b17e67b4b13d82537e01","observation_id":"f8a61c0f-4a65-4baa-96ab-c1ffd58b532d","resolution":{"observed_at":"2026-05-19T15:52:38.965819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"trainable property","venue":null,"work_id":"48df8123-344b-4ce9-98c6-b936a33dd273","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:e194a60c7979a70e7c6abe1f1971180648020dd435404155082169fff6a79823","observation_id":"3a152dbc-7de6-42ae-b2d8-4957d8f33a28","resolution":{"observed_at":"2026-05-19T15:52:38.973338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"persisting with 47 Pareto.ai LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design May 2026 similar or domain-typical designs despite weak or stagnant outcomes","venue":null,"work_id":"e1e2a64e-d4cc-49ed-b6eb-2903a5d2f27d","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:5a13ba522ad80e8b2a64352bc6e38c073a1690f90648f97d67ee0008e248e290","observation_id":"aff0ffc9-b847-40fa-bccd-7977240d7171","resolution":{"observed_at":"2026-05-19T15:52:38.963578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A couple did show quite firm anchoring, persisting with changing one tiny thing that clearly wasn’t working","venue":null,"work_id":"6b136319-4262-4ae1-94cc-4ff1e78095d6","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:8437f357a4b3f042cb5dabc8be1d6f29ce3906eea209cec23d1a07b186d5cac8","observation_id":"62dd09dd-052e-48bf-93d9-079de9b7490e","resolution":{"observed_at":"2026-05-19T15:52:38.971581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fleiss’𝜅= 0.33across the three raters (fair agreement, supporting evidence, not confirmatory)","venue":null,"work_id":"fc67fde8-2197-4460-8a4f-0967de8fb19c","year":2026},"citing_paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T15:50:01.064709Z"},"links":{"citing_paper":"/paper/2605.15341"},"observation_digest":"sha256:33567bec61ab3092c57ea3fd5c302e549de66ed3a9450a9be6f8d31b234e9ae7","observation_id":"dd25b1d5-1d36-4a05-8c0c-2642ef900988","resolution":{"observed_at":"2026-05-19T15:52:38.969689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.15341","last_updated":"2026-05-14T19:10:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T22:35:09.836244Z","submitted_at":"2026-05-14T19:10:45Z","title":"LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":5,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":9,"verified_fuzzy":24},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2605.15341."}