{"as_of":"2026-08-23T14:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25a21cf0cfeaca8d356dc8841c04d18744171cc55fd99d3f172bd362e7bed54f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:33:24.554504Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:22:25.349398Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:47:23.051268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2605.15766","last_updated":"2026-05-15T09:24:55Z","snapshot_observed_at":"2026-08-16T02:56:23.468014Z","submitted_at":"2026-05-15T09:24:55Z","title":"BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T19:31:32.334837Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2605.15766"},"observation_digest":"sha256:9d356eb4a55103e93101653e0f92c0c28ce55ec7fbb43c49b7b91f6dc7153ac5","observation_id":"8a6c22ae-54da-485f-aa4d-b980f06fa848","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2606.01145","last_updated":"2026-07-06T16:09:36Z","snapshot_observed_at":"2026-07-30T15:24:45.114962Z","submitted_at":"2026-05-31T10:27:18Z","title":"Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches","version":2},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-06-28T17:35:01.285534Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2606.01145"},"observation_digest":"sha256:9c6a9a21ff85d309f3aaf98f2d229006c7c61cdf9db55d58a3ba3195afaa1615","observation_id":"09b484fe-03b4-46c2-b55f-666496e43373","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2606.01145","last_updated":"2026-07-06T16:09:36Z","snapshot_observed_at":"2026-07-30T15:24:45.114962Z","submitted_at":"2026-05-31T10:27:18Z","title":"Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches","version":3},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-07-01T07:22:25.349398Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2606.01145"},"observation_digest":"sha256:29196c43595afea8111cb65b90d8423d3cc004a94272cd13ba9ccb610494fe9b","observation_id":"f291752a-eb15-4872-a448-dad8c0f8df51","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2606.04579","last_updated":"2026-06-22T14:19:37Z","snapshot_observed_at":"2026-08-13T03:34:36.766747Z","submitted_at":"2026-06-03T08:13:27Z","title":"SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T06:38:37.969788Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2606.04579"},"observation_digest":"sha256:ef4ab640d0cc43bff3a558c7650bfd83afbe1ac3a7424704948b90a85929981c","observation_id":"241fbc7c-ba67-4fdf-9979-5cf8b7839721","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-19T01:23:57.151803Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:170df2ff21443b1dda23ab27fc970d2efc71505a9701499c4a7abdb30757f1d2","observation_id":"cd8caa39-9c92-487b-b70b-1771377efa11","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07889/citation-record","integrity":"/paper/2505.07889/integrity","json":"/paper/2505.07889/citation-record.json","paper":"/paper/2505.07889"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:33:24.030229Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.030229Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:05057d7f82646eb4f2e858111cc6ddbafc327fe913e5428412663dd6f2c61318","observation_id":"4ef48869-c7f9-4272-a554-53979c5e0b89","resolution":{"observed_at":"2026-08-15T22:33:24.030229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-15T22:33:24.035130Z","title":"Palm 2 technical report.arXiv preprint arXiv:2305.10403, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.035130Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:ea484d78379da9c227ca47b24bb027f41925a5e7e934ee02c46975a54a782a1f","observation_id":"cc59d3f1-5c72-42ab-af7b-a5ebdd53defe","resolution":{"observed_at":"2026-08-15T22:33:24.035130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.798551Z","title":"Claude 3.7 sonnet system card, Feb 2025","venue":null,"work_id":"e7687588-4bbe-4450-b6c7-4a2f68885b15","year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.039516Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:9a340bdaf1334c1f1c48c9edd8797052afbe6006199c42b9677e4b72167468f9","observation_id":"bfc01981-4d2b-4918-b3ba-f16dfcee5a7b","resolution":{"observed_at":"2026-08-15T22:33:25.802465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.764323Z","title":"Cardbiomedbench: A benchmark for evaluating large language model performance in biomedical research.bioRxiv, pages 2025–01, 2025","venue":null,"work_id":"7fce5901-edac-47a9-9891-afb1e2fae0da","year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.043316Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:05a9f6f8640c4c1552cdd85318f367a18e263dc23744a820c95fe5e3e756e08c","observation_id":"482e647f-e966-4a15-939d-5d24d7e421f4","resolution":{"observed_at":"2026-08-15T22:33:25.791612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.047620Z","title":"Autonomous chemical research with large language models.Nature, 624(7992):570–578, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.047620Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:b0dd314cf7553a06e9164196290a3ba04fbd8c3deb97caef4a772f6bff0920a9","observation_id":"c72c7b79-7a63-4aaa-8664-167a84d8c4a8","resolution":{"observed_at":"2026-08-15T22:33:24.047620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.634038Z","title":"Language models are few-shot learners","venue":null,"work_id":"13136191-6219-490a-9755-25eeda297614","year":2020},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.051899Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:348b472ab466e769fed3dc1d788867ff05459ca74d23d19d3af8ae34260991c4","observation_id":"56e6fa41-a771-483f-aaf6-b4d00359f140","resolution":{"observed_at":"2026-08-15T22:33:25.681398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.575999Z","title":"Probio: A protocol-guided multimodal dataset for molecular biology lab.Advances in Neural Information Processing Systems, 36:41543–41571, 2023","venue":null,"work_id":"75fadddb-01e7-4f88-9d62-9e4c7f4dfcff","year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.056027Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:10c3dbee816e1735a8df2451fe8d74b0011a0bcbbb0cee559a54bd3a632d8afe","observation_id":"e2775839-3772-49b5-9fdf-e59b6b01065f","resolution":{"observed_at":"2026-08-15T22:33:25.606712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.518661Z","title":"Introducing gemini 2.0: Our new ai model for the agentic era, Dec 2024","venue":null,"work_id":"a0e21dc1-3648-41bb-9ba7-8a0ff1248cb8","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.059497Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:2d74791b454779c6081b53181fdec8e25ca3a2912529f18db60b80437bbba9ff","observation_id":"a16224dd-1988-49ef-b422-450ba6ef2f69","resolution":{"observed_at":"2026-08-15T22:33:25.522604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.507450Z","title":"Introducing gemini 2.5 pro experimental (model id gemini-2.5-pro-exp-03-25)","venue":null,"work_id":"d4742ca9-75bf-4e95-bb7b-4ec3b559a7aa","year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.063042Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:2f835c26ddbcb5d9955db4d7faaea4c5159996a17b7dfffaa215da1783f1b432","observation_id":"27bfc0ea-2f04-4e5b-a1d7-de2e19d0ff58","resolution":{"observed_at":"2026-08-15T22:33:25.511214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.496232Z","title":"Keybert: Minimal keyword extraction with bert., 2020","venue":null,"work_id":"faa8ecdc-6bb7-4c87-bc66-3860d359498b","year":2020},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.067096Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:04851e93691b820a9672f5e0f84ee5d990bf0bcfbd4a75c364365c34d027bbc7","observation_id":"dd86a53a-1e3d-401b-a59d-c5c222ab10b4","resolution":{"observed_at":"2026-08-15T22:33:25.500250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T22:33:24.071249Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.071249Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:63ad3bb1e7d71b343ca46540bde6686f8c59eb2f28762c51e740932427a67999","observation_id":"26573b03-3ecc-4e7d-a820-5a83d1ce8a46","resolution":{"observed_at":"2026-08-15T22:33:24.071249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.485922Z","title":"Biolp-bench: Measuring understanding of biological lab protocols by large language models","venue":null,"work_id":"e71bfe2c-2f05-4177-a37b-b898d8184bda","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.075045Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:6a60c46d6d5023d2b1675b64d066d9045699075f0a06b65c26e0990cda890a88","observation_id":"9ccf2c3c-635c-4251-8ca1-5807ef8d2619","resolution":{"observed_at":"2026-08-15T22:33:25.489654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.474615Z","title":"A comprehensive evaluation of large language models on benchmark biomedical text processing tasks.Computers in biology and medicine, 171:108189, 2024","venue":null,"work_id":"ea4dfa88-2085-40de-a875-f0fdbc53132c","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.078626Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:03e5d5e838a60dcc72cfe9ea625748ff6aa1a9db2fcec1556147c1b52990c35e","observation_id":"4386f693-a154-4904-a871-ebaf76bcd542","resolution":{"observed_at":"2026-08-15T22:33:25.478126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.340697Z","title":"Pubmedqa: A dataset for biomedical research question answering.EMNLP 2019, 2019","venue":null,"work_id":"80e0b7ef-00a8-4587-b0c8-ba45bc364cca","year":2019},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.082176Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:1b577f6bd7697055d9cb267ad189f4fcdb53932508889edee9920c007e13228e","observation_id":"2632edba-e4b9-4627-b43c-2634e3f632f9","resolution":{"observed_at":"2026-08-15T22:33:25.404547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.118123Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.118123Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:fbe80bf871e76a669a1e8a40a74e6fc0eecc15f6b7b31771e1f2f8b8689aff34","observation_id":"9ef99e5b-04b3-49da-b4f2-aa4e84c5aaa5","resolution":{"observed_at":"2026-08-15T22:33:24.118123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10362","last_updated":"2024-07-17T17:28:36Z","snapshot_observed_at":"2026-08-14T18:51:32.041872Z","submitted_at":"2024-07-14T23:52:25Z","title":"LAB-Bench: Measuring Capabilities of Language Models for Biology Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10362","snapshot_observed_at":"2026-08-15T22:33:24.166885Z","title":"Lab-bench: Measuring capabilities of language models for biology research.arXiv preprint arXiv:2407.10362, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.166885Z"},"links":{"cited_paper":"/paper/2407.10362","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:20c5f415f14ccc5d768f7afad0f1c0fcee5f9f783685b8be5832f90be68e5e6a","observation_id":"fe76b110-c84f-4464-8320-63463f1e24c7","resolution":{"observed_at":"2026-08-15T22:33:24.166885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.222169Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.222169Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:502bb5a407fd33ae0108fde702b23a2e7ce5e6b8b999f0b1f15817235c0ae446","observation_id":"2b18c5d4-a79f-4cc8-9f86-874115103139","resolution":{"observed_at":"2026-08-15T22:33:24.222169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.220473Z","title":"Can large language models reason about medical questions?Patterns, 5(3), 2024","venue":null,"work_id":"1887114f-6cd9-4281-8d0b-d3c68acb16d1","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.277179Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:9c950c7ed6af8153e6e4cc1ff4ef57329d8523a56c3804ec169810aab6c00bad","observation_id":"b612ac02-2311-4d73-94f1-62a8e16b5137","resolution":{"observed_at":"2026-08-15T22:33:25.269643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T22:33:24.330357Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.330357Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:c496f8768ec6fbdd31f09d7ced318b3c32b318405dc3443b2dbd63900b5ed2fb","observation_id":"0ab93968-88a9-479b-9c01-077aeb514815","resolution":{"observed_at":"2026-08-15T22:33:24.330357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.179167Z","title":"Biogpt: generative pre-trained transformer for biomedical text generation and mining.Briefings in Bioinformatics, 23(6):bbac409, 2022","venue":null,"work_id":"a17a4f75-8497-40ee-a69a-f95434dcae69","year":2022},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.388337Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:5ad56f8a7b1d0dcd52eba6177367a8739bbd2175be293a3d16b438764b562494","observation_id":"3fed51ad-583f-48e6-b1fd-43ba99d26226","resolution":{"observed_at":"2026-08-15T22:33:25.182310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09442","last_updated":"2023-08-21T07:49:37Z","snapshot_observed_at":"2026-08-16T15:07:36.233539Z","submitted_at":"2023-08-18T10:14:35Z","title":"BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09442","snapshot_observed_at":"2026-08-15T22:33:24.399333Z","title":"Biomedgpt: Open multimodal generative pre-trained transformer for biomedicine.arXiv preprint arXiv:2308.09442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.399333Z"},"links":{"cited_paper":"/paper/2308.09442","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:52885141a15d95f349035942d2a1f9fc8695f0e6c9cb4f573419484bbc07575c","observation_id":"ab4bce7d-b830-4ab8-9844-f5395712c16c","resolution":{"observed_at":"2026-08-15T22:33:24.399333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.419662Z","title":"Bixbench: a comprehensive benchmark for llm-based agents in computational biology.arXiv preprint arXiv:2503.00096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.419662Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:ce54fcc66e9c8fbd6816140adab33df0bee93940a32d40ea5c69f6bb7ffe7d0b","observation_id":"37d42c6d-bd1a-4df5-85f0-793c9d74234a","resolution":{"observed_at":"2026-08-15T22:33:24.419662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.168899Z","title":"Laboratory automation and high-throughput biology, 2024","venue":null,"work_id":"22b8ee93-afa4-46c9-a075-c8e71bae9241","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.425395Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:b3f073aaa46214b534dce516f1ea96a08ca0881ee744f3a3cae2f9bdc937ae12","observation_id":"f95fd62a-c51a-4737-bc82-783b07465ad8","resolution":{"observed_at":"2026-08-15T22:33:25.172610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-16T14:39:48.082697Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-15T22:33:24.437379Z","title":"Can generalist foundation models outcompete special- purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.437379Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:688bcd7f7ea66626acaeef6647f8be7fd3d1f36c6dfdf62410f7baeb1f465308","observation_id":"646a9bc7-982a-4d76-89fb-95d5d86769d1","resolution":{"observed_at":"2026-08-15T22:33:24.437379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.156149Z","title":"Openai announces gpt-4 turbo, 2023","venue":null,"work_id":"bd5e4af1-93a8-453e-871b-652f7d97bc97","year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.445630Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:3386c3a4c1b4cf8052eae8e133d482048e88a763938ac36e7b9285c7cf7ca06e","observation_id":"d53d2074-19c5-4fa2-bd36-f874e87b6e5e","resolution":{"observed_at":"2026-08-15T22:33:25.159787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.140291Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"d3e59874-09a3-4b1d-b9df-fe9ea7e95f80","year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.450152Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:5910713ebf2df3a43b90dbcb605dc7f53a776c57d7434734e80454f4564751c9","observation_id":"327a174e-6835-4788-b762-5dda3502423c","resolution":{"observed_at":"2026-08-15T22:33:25.144263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.119757Z","title":"Bioplanner: automatic evaluation of llms on protocol planning in biology","venue":null,"work_id":"c07b9f54-e266-4fa6-bb06-461e26a6a560","year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.456245Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:eba19f1bc92a5115ef07e137232031d42258cf41bcff6a100a20d41e77fc0524","observation_id":"8c18fcf0-9521-4352-ab23-d3b361c5d92c","resolution":{"observed_at":"2026-08-15T22:33:25.125544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.097042Z","title":"Qwen2.5 -72b-instruct, 2024","venue":null,"work_id":"909c94e4-eff6-4559-9e39-6dfd58335420","year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.459348Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:7778d6c0e96f84b79971285b252b787dd853be834a008d913ea92f4044f06b70","observation_id":"23ad8e47-517a-4e07-a782-3b76fe763067","resolution":{"observed_at":"2026-08-15T22:33:25.100255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.084907Z","title":"Qwq-32b, 2025","venue":null,"work_id":"086554f2-57d2-4547-8ad5-2e10df684cf3","year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.462848Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:8c65be248d03a6b523d5ffb43f6c169cd76d0d98351a3af4264d07e3bc9d3f24","observation_id":"8141858d-35af-4c05-ac07-c1c8296b72cd","resolution":{"observed_at":"2026-08-15T22:33:25.088365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.466494Z","title":"Towards scientific intelligence: A survey of llm-based scientific agents.arXiv preprint arXiv:2503.24047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.466494Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:13975228f80b3b2a7fe4a447094e4517d9ad6c16541500d412ca69a1cd310c2e","observation_id":"28bbac65-ea09-4246-9588-ff164292dad3","resolution":{"observed_at":"2026-08-15T22:33:24.466494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.469288Z","title":"Toward expert-level medical question answering with large language models.Nature Medicine, pages 1–8, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.469288Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:7f93cf93af643baab7d21e7cdec033e688b9de2a73ecf90271bca6970656d4f1","observation_id":"82146d74-9232-46be-a82a-7a24a3cb7648","resolution":{"observed_at":"2026-08-15T22:33:24.469288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T22:33:24.472820Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.472820Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:aa0a451e24c5248e7ae933ecef22d505ba1af992e7fc0df61805f625e09292a5","observation_id":"d418fada-59b7-4993-82a9-8326cddcb5ec","resolution":{"observed_at":"2026-08-15T22:33:24.472820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.476436Z","title":"Large language models in medicine.Nature medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.476436Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:3bdb1d852cac1ab60089cbe53bc0a5a2d33e6a146a22d69dec675fc66c8e4cd5","observation_id":"d7ce34c2-ff60-41f3-9daf-27129c411f16","resolution":{"observed_at":"2026-08-15T22:33:24.476436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T22:33:24.479666Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.479666Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:c6239185f00be0feb32740e8e8499865ca5cf7519991aef013317ca33a867867","observation_id":"85bb4287-4c4e-4b41-9dc3-49f380de8a00","resolution":{"observed_at":"2026-08-15T22:33:24.479666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:25.054877Z","title":"An overview of the bioasq large-scale biomedical semantic indexing and question answering competition","venue":null,"work_id":"ae46009b-30bb-43ae-a624-8b731176bc01","year":2015},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.483551Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:158cfecef63fe8069200b9c76536f3d2d8e3eb509c5f1ef7985f9f6bd1722405","observation_id":"5caf1e77-09dc-4e02-9204-7aa3370c991f","resolution":{"observed_at":"2026-08-15T22:33:25.058938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.486899Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.486899Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:7376b839c978032f2e43fc0a062a9fb98ff16961800b4a061c859a2e1c16f25e","observation_id":"4d5c6e2f-1ebb-4486-b229-fc13c499554c","resolution":{"observed_at":"2026-08-15T22:33:24.486899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03162","last_updated":"2024-05-06T04:44:22Z","snapshot_observed_at":"2026-08-16T13:55:11.369835Z","submitted_at":"2024-05-06T04:44:22Z","title":"Advancing Multimodal Medical Capabilities of Gemini","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03162","snapshot_observed_at":"2026-08-15T22:33:24.490545Z","title":"Advancing multimodal medical capabilities of gemini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.490545Z"},"links":{"cited_paper":"/paper/2405.03162","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:7cdb4ddcc00476a5ae25115fb29538dc2f1ce7592b05e926ed3e9428def28d69","observation_id":"047d94bc-00c6-4307-841a-53dd228c3ccf","resolution":{"observed_at":"2026-08-15T22:33:24.490545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03905","last_updated":"2022-04-22T07:47:42Z","snapshot_observed_at":"2026-08-18T01:43:29.299543Z","submitted_at":"2022-04-08T08:07:42Z","title":"BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03905","snapshot_observed_at":"2026-08-15T22:33:24.493818Z","title":"Biobart: Pretraining and evaluation of a biomedical generative language model.arXiv preprint arXiv:2204.03905, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.493818Z"},"links":{"cited_paper":"/paper/2204.03905","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:8633807ef45e098683931cb659514910ea5d5cab5cc0002cc451654005df9ce6","observation_id":"37528c27-9505-4911-8ad2-b5deb8bf9387","resolution":{"observed_at":"2026-08-15T22:33:24.493818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:24.990197Z","title":"Benchmarking large language models on safety risks in scientific laboratories.Nature Machine Intelligence, 2026","venue":null,"work_id":"557dcd63-5bf5-476d-b3df-e46892bb0c6c","year":2026},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.509725Z"},"links":{"citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:0959ad4cb2fcdfa3b4c90f8f96164ecad50ef9f581ea295e191e30ae5dae22fc","observation_id":"0f158872-d2a1-48d3-9766-ddbafec2954f","resolution":{"observed_at":"2026-08-15T22:33:25.037402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-08-17T19:58:59.903876Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-15T22:33:24.554504Z","title":"Medxpertqa: Benchmarking expert-level medical reasoning and understanding.arXiv preprint arXiv:2501.18362, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:33:24.554504Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2505.07889"},"observation_digest":"sha256:74c59d2bb05f73a5d3ef92de31d49d1726cbfafe9e74e602de7b6631248459ce","observation_id":"00c3fdb2-6f00-44be-bef9-dc76724c0ff6","resolution":{"observed_at":"2026-08-15T22:33:24.554504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T01:47:45.036432Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 5 inbound Pith citation observations for arXiv:2505.07889."}