{"as_of":"2026-08-09T02:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:696cd2f0f399eb0df94da977bae66758d6eba8ffc2c47052cba102dc9a16fdbf","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:29:10.888735Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07237/citation-record","integrity":"/paper/2502.07237/integrity","json":"/paper/2502.07237/citation-record.json","paper":"/paper/2502.07237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.451377Z","title":"De novo drug design using reinforcement learning with graph-based deep generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.451377Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b242879fce5f36f9758ff3aa6edb912453e585248052873674995fe3a4fc520a","observation_id":"23139c04-27bb-4f7e-813b-580216ed1d9f","resolution":{"observed_at":"2026-08-08T13:29:10.451377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.456789Z","title":"DrugCentral 2023 extends human clinical data and integrates veterinary drugs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.456789Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:885f41c091dfde37c3a77a5c5ce676a26d5feedd0b2df3b5c9caa7bd66a029de","observation_id":"9d0e9410-cafb-4473-8484-46ad1e2101fb","resolution":{"observed_at":"2026-08-08T13:29:10.456789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.461807Z","title":"MolGPT: Molecular generation using a transformer-decoder model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.461807Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b5a022ea8e32d0d78c05621676bf2b82259192e6cf3ca69e8116f840cc2d1fae","observation_id":"094e99f4-dcb2-4b13-bcd7-7b6683564a28","resolution":{"observed_at":"2026-08-08T13:29:10.461807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-08T13:29:10.467246Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.467246Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ab488451aac77edcc94cc3bd5e608b282d1948df539b8b9db7180bbe1b8a18ef","observation_id":"ccb5f472-fa15-445f-bb50-8fa447178299","resolution":{"observed_at":"2026-08-08T13:29:10.467246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-08T13:29:10.472852Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.472852Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:964f0c95c065f311646318536124c160727aeeecd1830d862de2ca9dd811313b","observation_id":"82d291ee-f4ce-4ba9-b9d1-b0baf5213678","resolution":{"observed_at":"2026-08-08T13:29:10.472852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.478424Z","title":"Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.478424Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a274d7b4e84540617a4fb33bbd087d5bf401cc905d476264a994e3c0848eee7e","observation_id":"1fb99ddb-7d6c-4982-8791-c187bf18704c","resolution":{"observed_at":"2026-08-08T13:29:10.478424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.483408Z","title":"Molecular similarity: a key technique in molecular informatics","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.483408Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:bcaee7c5139ef5c801f110ad22b1b6b8aff281f010ef912582ee89440557a920","observation_id":"8cec44a0-b99d-494d-894c-40502357271f","resolution":{"observed_at":"2026-08-08T13:29:10.483408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01214","last_updated":"2019-09-03T14:30:13Z","snapshot_observed_at":"2026-07-06T08:18:43.473503Z","submitted_at":"2019-09-03T14:30:13Z","title":"Better Rewards Yield Better Summaries: Learning to Summarise Without References","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01214","snapshot_observed_at":"2026-08-08T13:29:10.488851Z","title":"Better rewards yield better summaries: Learning to summarise without references","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.488851Z"},"links":{"cited_paper":"/paper/1909.01214","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:12c609437da190950075cb4d29b631df7e1de87f14f6a3634bf4c497ea0f1446","observation_id":"908a204e-7b65-4486-828e-6f67e9028956","resolution":{"observed_at":"2026-08-08T13:29:10.488851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.493944Z","title":"Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.493944Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0ad0c46ca2738588942f1722c5f221df5a16c8863a3859ca2d95d8b19aedf6ad","observation_id":"36739dfb-d947-46c7-a108-9d1f8d560c50","resolution":{"observed_at":"2026-08-08T13:29:10.493944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06083","last_updated":"2023-10-09T18:40:04Z","snapshot_observed_at":"2026-08-06T20:54:44.673745Z","submitted_at":"2023-10-09T18:40:04Z","title":"Transformers and Large Language Models for Chemistry and Drug Discovery","version":1},"cited_work":{"arxiv_id":"2310.06083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06083","snapshot_observed_at":"2026-08-08T13:29:11.417873Z","title":"Transformers and Large Language Models for Chemistry and Drug Discovery","venue":"cs.LG","work_id":"e591d9bb-b148-4cdf-bdaf-3fec409e23ce","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.498827Z"},"links":{"cited_paper":"/paper/2310.06083","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:753d5cba9057e10d511c69a5a7c7e232018b4032ce4eef1030b029e12876b930","observation_id":"0a097645-0b34-49a0-99ab-973421e42fee","resolution":{"observed_at":"2026-08-08T13:29:11.423383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.504287Z","title":"Offline rl without off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.504287Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:aac17c63d5da4c5280928ea8f2398ad78f06b888e7c5779e9a1a666f0a859295","observation_id":"6a5f96de-cb61-450e-bbcb-094a52ef9aaf","resolution":{"observed_at":"2026-08-08T13:29:10.504287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.509689Z","title":"Safe learning in robotics: From learning-based control to safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.509689Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:b6383d5eb2117c507c3bceed84a02c65979bea03683cb8740197ab8092f461cd","observation_id":"f5663653-79bf-4e7d-83ff-f771d6600718","resolution":{"observed_at":"2026-08-08T13:29:10.509689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.320989Z","title":"Policy improvement via imitation of multiple oracles","venue":null,"work_id":"6802ab26-0547-4a57-ba35-061eb2560c47","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.514629Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0f75f0e9e4c6bac274c5d5e9563264eec841b30488b631ba04d2ba89647cee16","observation_id":"b206893b-d305-46af-9ba2-a6d27ec1fd6e","resolution":{"observed_at":"2026-08-08T13:29:12.326377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.305828Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"56aef8bf-20eb-4f58-af1f-e2b15a88a307","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.519703Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f8f9a4a942224d59664d025905551aa3603bc36f0b66497e4519b6f711fef418","observation_id":"ffe4e10b-1f35-416f-9024-d5175ba07ca6","resolution":{"observed_at":"2026-08-08T13:29:12.310763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.290768Z","title":"Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection","venue":null,"work_id":"3f8e2b59-3354-491c-a270-39c0d59fe29d","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.524690Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:4911cad879e3ec75a4489b9947de206ba503551bb77316fdd83984a03eafb481","observation_id":"6d6b85ae-ff03-40d4-8545-30fe36030596","resolution":{"observed_at":"2026-08-08T13:29:12.295680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.275255Z","title":"The cost of new drug discovery and development","venue":null,"work_id":"1297d79f-5099-439a-aeed-41a3e5cd0f81","year":2009},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.529941Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f32f3ffb9f90335e96709a15ad87dab27b47f4cf2753662649fab85c39b2b490","observation_id":"f8011063-e22b-4fe0-b4c1-f863cc232dce","resolution":{"observed_at":"2026-08-08T13:29:12.280350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-08T13:29:10.536482Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.536482Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9eb042a58dedb0995103bd8e88a1edd14e562079f184a4394f11f89433d4708f","observation_id":"6408ef31-5451-4b82-9dd6-5bc38750038f","resolution":{"observed_at":"2026-08-08T13:29:10.536482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.259984Z","title":"Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions","venue":null,"work_id":"a75b7175-e38c-4bfb-8493-10e6243c3447","year":2009},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.541731Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e26bd4e850f4d8ee4e95e5a52de6f8057239ab821c0e2451ab646dcc911c7b49","observation_id":"dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc","resolution":{"observed_at":"2026-08-08T13:29:12.264876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.244901Z","title":"Neural scaling of deep chemical models","venue":null,"work_id":"436cb571-7b6b-410e-91ff-a7e19f9525e5","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.546660Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9a2c8e746a98cdfd8513015ab094a3aa43429b47d4b433743e702c3225825894","observation_id":"e225d3ef-bfcd-48bb-a2cc-4e3f05adb878","resolution":{"observed_at":"2026-08-08T13:29:12.249858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.229600Z","title":"Mimosa: Multi-constraint molecule sampling for molecule optimization","venue":null,"work_id":"358a717a-6327-4bcf-8feb-062fd8477caa","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.551668Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9ea1b8d3986a77499b1418af00495e2feb138bc4730b6cf8357317f75dd9aa49","observation_id":"99205759-fa1f-4eba-8e4d-fd3042074733","resolution":{"observed_at":"2026-08-08T13:29:12.234419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.214023Z","title":"A new algorithm for data compression","venue":null,"work_id":"5a9d8ced-a86b-4b33-bb4c-7738faeb777e","year":1994},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.556435Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:26eb01dcb2fec5dd131c515d167eb08ed00b3caa703711cd36c8ec5373e30fea","observation_id":"4a7f36a5-e36b-4f42-b179-3ffa4f7b6085","resolution":{"observed_at":"2026-08-08T13:29:12.218993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.197854Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"96c30e5e-0490-4958-b992-f3d665560e1b","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.561585Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f089b05d21a38d369da58a0b3be7770b67c894e1d32c8170c18064d882650f02","observation_id":"b376e5c0-8b05-4431-ad25-18d3f51c0417","resolution":{"observed_at":"2026-08-08T13:29:12.203370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.182608Z","title":"Learning to navigate the synthetically accessible chemical space using reinforcement learning","venue":null,"work_id":"100f398c-74d7-4cdb-9748-3ba5170098ad","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.566706Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:fd24f40b8082bff3d8a8e5fe9d14a5415d95f595445a510f293c1e6c8c054cdf","observation_id":"e21d29d2-23bd-4f8d-906e-1ae1ef185db7","resolution":{"observed_at":"2026-08-08T13:29:12.187597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10843","last_updated":"2018-02-07T04:58:57Z","snapshot_observed_at":"2026-07-31T23:26:47.539311Z","submitted_at":"2017-05-30T19:58:08Z","title":"Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10843","snapshot_observed_at":"2026-08-08T13:29:10.571560Z","title":"Objective-reinforced generative adversarial networks (ORGAN) for sequence generation models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.571560Z"},"links":{"cited_paper":"/paper/1705.10843","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:985e13b36339d59118bc3b8fb8e2a530b5307219a6a47cef81a9ed4aa09b5eb9","observation_id":"d32b5402-a510-45ef-b87b-616781316bb6","resolution":{"observed_at":"2026-08-08T13:29:10.571560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.167273Z","title":"Covid-19 vaccines and variants of concern: A review","venue":null,"work_id":"cfe4e3c2-d204-4d46-9b02-a516a4dc7d82","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.576746Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:77e6864dc9c7a0cfa221fb89383f4cbafebb59af0236a20bcfa37d1842aeb73d","observation_id":"b7304e96-c6e4-4c95-91ca-e36e862cec1b","resolution":{"observed_at":"2026-08-08T13:29:12.172238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.05415","last_updated":"2019-06-13T06:01:04Z","snapshot_observed_at":"2026-07-06T07:27:07.482501Z","submitted_at":"2019-01-16T18:02:44Z","title":"Learning from Dialogue after Deployment: Feed Yourself, Chatbot!","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.05415","snapshot_observed_at":"2026-08-08T13:29:10.581537Z","title":"Learning from dialogue after deployment: Feed yourself, chatbot! arXiv preprint arXiv:1901.05415, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.581537Z"},"links":{"cited_paper":"/paper/1901.05415","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d1b95b7c17b0c7c5546f07c9390bf717e55ea6217416c05e2d356bbf8afd4704","observation_id":"0e52c434-b836-469b-ab68-9ec432686a76","resolution":{"observed_at":"2026-08-08T13:29:10.581537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.151322Z","title":"Molecular optimization by capturing chemist’s intuition using deep neural networks","venue":null,"work_id":"6e740e88-852d-447f-b411-d835be355d8f","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.587407Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:13faf99e4a4a14e5dcd153b8738a03f692395e0ca300bb0bb637cc5681d11564","observation_id":"114d79ca-e711-4826-a1ba-021da26e1722","resolution":{"observed_at":"2026-08-08T13:29:12.156432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.136352Z","title":"Transformer-based molecular optimization beyond matched molecular pairs","venue":null,"work_id":"2f68c9af-f46c-4a86-bc83-d8bc5e9046da","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.592697Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:13d8fa71fc3a241b01fbd4dca905a1a0e6665ab269f24cb7db02ff69fcc1fed3","observation_id":"dde8d5c8-2416-45be-b872-05cb4270c05b","resolution":{"observed_at":"2026-08-08T13:29:12.141145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.121396Z","title":"Reward learning from human preferences and demonstrations in atari","venue":null,"work_id":"0e37f24f-d9b6-499e-8272-91fe06964c32","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.597480Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9ba78276552f9c123c78d0b5293901622bbf9f541094ea11bd09d60e72264f11","observation_id":"5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3","resolution":{"observed_at":"2026-08-08T13:29:12.126101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.106559Z","title":"The distribution of the flora in the alpine zone","venue":null,"work_id":"1872b662-eba7-4cc9-bcf7-ddbe0f204c0b","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.601947Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:8757be46f771ab3d7acaef16d4c36ceb2c698ec569cdd7801bd7dda863e94449","observation_id":"ae7472bf-2b7d-46c6-8e9a-b17704c9eefa","resolution":{"observed_at":"2026-08-08T13:29:12.111431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-08T13:29:10.606901Z","title":"Way off-policy batch deep reinforcement learning of implicit human preferences in dialog","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.606901Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1282382f234847492ec2e99b2f60353cf6d9752114fcda43c31d25c341055da4","observation_id":"aa297f5a-ade7-4a7d-b120-6cebc83fd29e","resolution":{"observed_at":"2026-08-08T13:29:10.606901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.091868Z","title":"A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space","venue":null,"work_id":"32c042e9-6b9a-44d9-bd24-b80a6e25202f","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.612042Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:496cab600f8e66f9aee75f3b6ad7261ed29e212c3b21bb0a7f103f976e9c3612","observation_id":"fece7bd0-12ae-4d39-b813-073e94735335","resolution":{"observed_at":"2026-08-08T13:29:12.096586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.076058Z","title":"Multi-objective molecule generation using interpretable substructures","venue":null,"work_id":"f9901a32-8301-40a0-9699-771c8420c9ee","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.616638Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1690468252e467af026ab8ffbe966afded782c0d1baf310978b694664b4b5bb7","observation_id":"9d3aabbc-ec55-47f2-a8b1-249e90dd010c","resolution":{"observed_at":"2026-08-08T13:29:12.081061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.060711Z","title":"Posit: flexible shape-guided docking for pose prediction","venue":null,"work_id":"0e6839bd-f046-4e1b-a7df-60fff0854b1e","year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.621388Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e9a4928edaa028f864dd4c3ed60ee50f3a202a60dee0ce77b861339b5393a9b3","observation_id":"cb0cd3ed-101b-4b17-afec-2b76042e4c5b","resolution":{"observed_at":"2026-08-08T13:29:12.065686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01549","last_updated":"2015-09-14T15:42:35Z","snapshot_observed_at":"2026-07-06T04:28:51.025619Z","submitted_at":"2015-09-04T18:21:52Z","title":"Giraffe: Using Deep Reinforcement Learning to Play Chess","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01549","snapshot_observed_at":"2026-08-08T13:29:10.626000Z","title":"Giraffe: Using deep reinforcement learning to play chess","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.626000Z"},"links":{"cited_paper":"/paper/1509.01549","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ca6366bfdf8efc934efaa46e00a5532ffe192e39d913750d384ad271d1467840","observation_id":"a001709c-5cf6-4e19-b714-4d43d8d6c97e","resolution":{"observed_at":"2026-08-08T13:29:10.626000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.045574Z","title":"RDkit: Open-source cheminformatics software","venue":null,"work_id":"ef5036dd-b715-463b-bf12-d72e3e6a4d67","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.631332Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a32ab0c88876db520159b5e8d07a5364e0baf763823f9c1f1d7db332ea80d21f","observation_id":"c7eed6fe-8191-457f-afc1-e099f4c25882","resolution":{"observed_at":"2026-08-08T13:29:12.050462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.029477Z","title":"Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling","venue":null,"work_id":"9c776c4b-974a-4cfe-8c68-9dbd0f7f280d","year":2013},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.635987Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9ae543131c75d5b419d9783dd4d2a27ee8e18c476dbc393df13d7b3859313180","observation_id":"7a663836-d1df-4baa-96fd-3b8c2d7ed932","resolution":{"observed_at":"2026-08-08T13:29:12.034338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-08T13:29:10.640998Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.640998Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c67f37caf15b066217ade997c775ef95a0f23467189ce5dbcbf95c58cdd632e3","observation_id":"f8dccded-8c51-48f6-b699-731479c7493b","resolution":{"observed_at":"2026-08-08T13:29:10.640998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:12.013565Z","title":"Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization","venue":null,"work_id":"cd8d5501-cc98-496e-8871-12e4dd9d789c","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.646464Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:76948ee3fbb75746be16d454380135447582b868fa783fca2484ccf384e58622","observation_id":"1a7dd7a7-bef0-403e-a139-deb71922ae6e","resolution":{"observed_at":"2026-08-08T13:29:12.018940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01737","last_updated":"2025-08-11T01:00:11Z","snapshot_observed_at":"2026-08-05T01:39:51.497362Z","submitted_at":"2023-10-03T01:55:54Z","title":"Blending Imitation and Reinforcement Learning for Robust Policy Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01737","snapshot_observed_at":"2026-08-08T13:29:10.651020Z","title":"Blend- ing imitation and reinforcement learning for robust policy improvement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.651020Z"},"links":{"cited_paper":"/paper/2310.01737","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1016b0c5d02c3ad1d8d79f3c3e8db626b127ccbbc7a8973c76223fdb34b63600","observation_id":"45814632-f5bc-4067-a44e-6ebf4a9eda45","resolution":{"observed_at":"2026-08-08T13:29:10.651020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.997646Z","title":"Active policy improvement from multiple black-box oracles","venue":null,"work_id":"ff5c17d5-5c2e-4552-a410-6c9078563b1b","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.655982Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:99497d0bf63b957a9b053a28f1c1aa3f9015ddc66d7674041981c3f36f38662f","observation_id":"d68f1ad5-5c2d-4a3e-9463-91497975427c","resolution":{"observed_at":"2026-08-08T13:29:12.002550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.982093Z","title":"Entropy-reinforced planning with large language models for de novo drug discovery","venue":null,"work_id":"1e7d0a69-4b32-4226-9c2f-0394aed49d14","year":2024},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.660687Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7c6e2db501e3c6e7f45fda320a41bb89bcd7a95472cba841149c736fc9b0352e","observation_id":"cbe878d8-589b-4a63-930d-8bb6f217e96f","resolution":{"observed_at":"2026-08-08T13:29:11.987215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.966613Z","title":"Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning","venue":null,"work_id":"d6b53f4d-a19c-43d6-8592-dbc1eae59424","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.665499Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c5c3a32c7b25d706b66aa9d16918ebb59bbf6c38aca02d409e65a6719fa85828","observation_id":"abe3419c-4ce9-4b80-b31d-9602a5d27bf9","resolution":{"observed_at":"2026-08-08T13:29:11.972163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.951290Z","title":"Reinvent 4: Modern ai–driven generative molecule design","venue":null,"work_id":"50ffd6b1-b8d3-418d-a751-6acaaf77bdd7","year":2024},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.670541Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a649d3311ae2ca592b03b6edbfb0cfc54a8d279470505ea08f4b35150f5fe2a3","observation_id":"f23e3ed9-0fd9-432a-96a1-000f1f2be132","resolution":{"observed_at":"2026-08-08T13:29:11.956432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.936229Z","title":"The different mechanisms of cancer drug resistance: a brief review","venue":null,"work_id":"199a64dc-54e4-45fb-9b6e-42391be57977","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.675183Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:3366c910e7cb86e54c93e4ca91f7cf086a203dfdb013cb7551e10740134d7810","observation_id":"92dd2be8-1865-48ae-946d-fe2f337ae38d","resolution":{"observed_at":"2026-08-08T13:29:11.941167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-08T13:29:10.679677Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.679677Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7141969d1706335d1862c00dd0827dbfe3875d1747e216e8dd5cec5ddc1b8fae","observation_id":"e480c6e2-d2ed-4c25-b705-2a498bc9e1ba","resolution":{"observed_at":"2026-08-08T13:29:10.679677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.921592Z","title":"Exploring deep recurrent models with reinforcement learning for molecule design","venue":null,"work_id":"408b27c2-f9df-446d-a793-726253685f37","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.684720Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7bd26159ce84ca381b765c7d3dce33a2129dd4e7e5c674e5a7433ac8a0c81e05","observation_id":"338e75be-78b2-4fd9-b61d-457709dea35e","resolution":{"observed_at":"2026-08-08T13:29:11.926339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.906943Z","title":"Molecular de-novo design through deep reinforcement learning","venue":null,"work_id":"11cfa8e7-118a-4641-8975-6e3323d6c7bf","year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.689475Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e5a72316e76cef3f6010cb44c559e7465170d0477e19cf4ad3b78cbc18a713d1","observation_id":"b4507f40-8c05-4b63-893c-b8f11b8e39df","resolution":{"observed_at":"2026-08-08T13:29:11.911596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-08T13:29:10.694293Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.694293Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:5502789d880f8e5a23489b6aa4b22fc74f1dd1ee239c677619432876b2e1c690","observation_id":"63ed8f5a-6c28-4931-880e-9b09de5fc5cb","resolution":{"observed_at":"2026-08-08T13:29:10.694293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.893195Z","title":"Combinatorial enumeration of groups, graphs, and chemical compounds","venue":null,"work_id":"a4550d89-5360-4de8-b57c-372d2a0fb8f8","year":2012},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.699598Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0be57d5bcb2a7518011f9d4616295d8b02619a3a1f32cb24e40357ffe97a1c77","observation_id":"05bb62f3-110c-4816-afd9-60a17d77301a","resolution":{"observed_at":"2026-08-08T13:29:11.897575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.878619Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":"07058ffe-3cd8-4c70-92ab-c75f6724db8b","year":1988},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.704511Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9bacaf412278e67c2d431a261c96f32d869ef50fe2503fa88684a3425e40769f","observation_id":"324daebc-83d2-460e-9377-5d455a92e951","resolution":{"observed_at":"2026-08-08T13:29:11.883398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.863506Z","title":"Deep reinforcement learning for de novo drug design","venue":null,"work_id":"714a0da2-cfb7-48ed-aa68-f6434b304e72","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.709787Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:549184a37fe830fc7da7055622c0e7a2d6b0994243463df4317603a993f9eeb8","observation_id":"04c6d37d-e073-472f-8d33-a72063f62fd4","resolution":{"observed_at":"2026-08-08T13:29:11.868339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.848685Z","title":"Drug repurposing: Progress, challenges and recommendations","venue":null,"work_id":"5c164867-045d-4ef9-a6ba-b386c50b0d69","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.714625Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:bd13d64363a8f80ccbee5306e83cb6e8605ee6168b1afbfd0242d9b0ed1aa0ef","observation_id":"6360c346-a16e-4542-b7ff-68aeffca25f5","resolution":{"observed_at":"2026-08-08T13:29:11.853447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-08T13:29:10.719469Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.719469Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:66887c3473512b60fea7a373d908b8145837bd6be71fa3e3f088ce9b046f6be8","observation_id":"82924bfc-aaeb-4363-9c18-367187623f97","resolution":{"observed_at":"2026-08-08T13:29:10.719469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.833446Z","title":"Learning by playing solving sparse reward tasks from scratch","venue":null,"work_id":"79adb9a4-ac36-4a83-970b-b9843f571030","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.724522Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:229cc517c98085efa53e0c8d7a583c141b73dae2fdad0325ded7bb7d8436b012","observation_id":"e6274477-7f12-4eb8-8b7f-b78cc1b06e12","resolution":{"observed_at":"2026-08-08T13:29:11.838474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.817842Z","title":"Extended-connectivity fingerprints","venue":null,"work_id":"cb505f32-3bfb-4dd8-9556-519e00cd66ab","year":2010},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.728977Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:30e55714998ee045f062d0df7fff33999a7b274d8a21bfdf435ea62ed79f2c33","observation_id":"9cf7afa3-b90c-453f-9ab1-185431ee459f","resolution":{"observed_at":"2026-08-08T13:29:11.822920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-08-08T13:29:10.733657Z","title":"Reinforcement and imitation learning via interactive no-regret learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.733657Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:eb0d0d7b962ebfcb67743eb840ea3b3d22d405798300f9b5b958396d6bec4a26","observation_id":"923c1ada-3d19-43c8-bf55-60a20962d984","resolution":{"observed_at":"2026-08-08T13:29:10.733657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.801686Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"0e9178e5-45b0-4bf9-9b68-77ac8de58182","year":2011},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.738675Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ad736379abf8a2fb523ec82c6113e1c9dc5c9558561f2069edb465581fa6075d","observation_id":"0f3302b8-5f07-40e5-a7e3-74df4faaa6cd","resolution":{"observed_at":"2026-08-08T13:29:11.807028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10307","last_updated":"2021-08-23T17:53:07Z","snapshot_observed_at":"2026-08-06T03:20:55.504286Z","submitted_at":"2021-08-23T17:53:07Z","title":"C5T5: Controllable Generation of Organic Molecules with Transformers","version":1},"cited_work":{"arxiv_id":"2108.10307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.10307","snapshot_observed_at":"2026-08-08T13:29:11.082574Z","title":"C5T5: Controllable Generation of Organic Molecules with Transformers","venue":"cs.LG","work_id":"7765daa6-6656-4020-a9a4-ca1f9f80000a","year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.743339Z"},"links":{"cited_paper":"/paper/2108.10307","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9f57eb7a1e9beb2dd83b8107612300425198417f58623909a78b2a35f51b4efe","observation_id":"08c26f04-fe45-446c-bb7e-c8d7bbe3b902","resolution":{"observed_at":"2026-08-08T13:29:11.090606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-08T13:29:10.748664Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.748664Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:639b882937ccefcf6457c316fbbc785b5892bc2a5ea0f5399baaf87d7ff825ca","observation_id":"e17aae1f-ad39-4e19-ad42-6afc84602047","resolution":{"observed_at":"2026-08-08T13:29:10.748664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17492","last_updated":"2024-02-27T18:42:42Z","snapshot_observed_at":"2026-08-02T19:39:02.664535Z","submitted_at":"2023-06-30T09:07:37Z","title":"Preference Ranking Optimization for Human Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17492","snapshot_observed_at":"2026-08-08T13:29:10.753720Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.753720Z"},"links":{"cited_paper":"/paper/2306.17492","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:a154adb25e2a7f52036296934926326cbc51480075e749d04d031c3b516104de","observation_id":"5178c9a0-2e29-46b7-b83a-c5196241925f","resolution":{"observed_at":"2026-08-08T13:29:10.753720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.784818Z","title":"Deep reinforcement learning for multiparameter optimization in de novo drug design","venue":null,"work_id":"f417ec54-b725-4e9b-ac1f-87c7d569ba41","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.758864Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:e4b16f29229f451347ebf45a3ea65eb6f0920911cb305aab6f1b248f5c055cba","observation_id":"10823088-7042-4c39-b78c-4c9fde3ca91f","resolution":{"observed_at":"2026-08-08T13:29:11.790337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.768857Z","title":"ZINC15–ligand discovery for everyone","venue":null,"work_id":"b0f5f1ee-4587-433e-a866-3bc3d1160f59","year":2015},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.763559Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c066097df1f78e4408704ea7bf750a5b2c22191df41206a1df751f1340fe9f01","observation_id":"37ee144e-2f30-4b2f-b5af-21356c0f20be","resolution":{"observed_at":"2026-08-08T13:29:11.774076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.753068Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"89b2301f-ec2f-4929-916d-99876ec36884","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.768526Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:6efd295075fddde9f04d5dc996cfed2644af12e8822b350a7b558b3882096bde","observation_id":"44a38208-e0ec-4566-a5d4-4d44c5fc3455","resolution":{"observed_at":"2026-08-08T13:29:11.758229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.737509Z","title":"Molsearch: search-based multi-objective molecular generation and property optimization","venue":null,"work_id":"a4070b05-d921-4152-9618-7de62d07999a","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.773329Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7120fb2d1a6f8eb1b3078acceed257ca157f2539bdacbdf988fb301d747ffb1f","observation_id":"15067d09-f0c6-4d66-9de7-7883d3521f85","resolution":{"observed_at":"2026-08-08T13:29:11.742320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.721614Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"168fc7df-f969-4967-8285-690ee74fa219","year":1999},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.778406Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:489c60f77599fe2387652b1e2e4d858a80614360c2ca94a5ef255cab2063eead","observation_id":"469feec5-13f5-47f2-8e77-8d19c8129579","resolution":{"observed_at":"2026-08-08T13:29:11.726293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.705344Z","title":"Reinforcement learning for systems pharmacology-oriented and personalized drug design","venue":null,"work_id":"2003ca89-ad37-4073-a15d-ac12a93cc142","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.783054Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:33bc7dc69a3379b340d708401bc6f4cc76d2c5bb79c2a8ab84b16bf0299f51e3","observation_id":"d3e42ab1-d33a-4709-affb-8a0690452915","resolution":{"observed_at":"2026-08-08T13:29:11.711259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.689680Z","title":"Drlinker: Deep reinforcement learning for optimization in fragment linking design","venue":null,"work_id":"9e8642c1-47b6-41d6-9b3d-60adecd3e9ce","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.788037Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0cb76485d650d687a72cab4a514dbfc444886cab53ea2a2dd6d86317703f9e8d","observation_id":"202f7111-55b2-412c-a7ae-549f1931acfe","resolution":{"observed_at":"2026-08-08T13:29:11.694766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:29:10.793596Z","title":"DeepMind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.793596Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9001f5bc03205de9b956c8dbaf8174b0a21f09d2f80901d1a445fa19e87b2e15","observation_id":"e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc","resolution":{"observed_at":"2026-08-08T13:29:10.793596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T13:29:10.799215Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.799215Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:9afdd6aca05a1d3447580be90667e5b315e16d4e8dff014493cf7f4652af9459","observation_id":"40b71e8d-b632-4ee5-9a72-464d617a31a7","resolution":{"observed_at":"2026-08-08T13:29:10.799215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.673839Z","title":"Matched molecular pair analysis in short: algorithms, applications and limitations","venue":null,"work_id":"02e873db-b7e3-402f-b9ae-02e47eb6eb78","year":null},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.804399Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1087058437d2623600e5c643882e7368953d5c74e0d1614a0237007edbac7c43","observation_id":"fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0","resolution":{"observed_at":"2026-08-08T13:29:11.678824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.657831Z","title":"Benchmarking language-based docking models","venue":null,"work_id":"737c7a0d-0189-4bf0-a2a3-082f2cee4cb4","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.809172Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:5f77bc59c3dfc54cae364a6b92125a9354023017ccd95ef8245781edd0e2c251","observation_id":"9a8ed734-2a4a-471a-84c4-28b01a56a7cc","resolution":{"observed_at":"2026-08-08T13:29:11.662679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:10.813976Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.813976Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:7307e3e8b3db56db8a24c9e59d77983c32fabb4736a3e7c0ac2e25044ad0e10f","observation_id":"8bf24568-87e4-47ae-9c4b-bf637c89ade6","resolution":{"observed_at":"2026-08-08T13:29:10.813976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-08T13:29:10.818690Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.818690Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:11de412b0990b2e0fb675fd49842b00c0ee9d3ccaed8fbbbc5dc9d1c8afba6c7","observation_id":"52f6e24d-3e2b-4499-baeb-dc4bc2aab748","resolution":{"observed_at":"2026-08-08T13:29:10.818690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.630768Z","title":"A reinforcement learning approach for protein–ligand binding pose prediction","venue":null,"work_id":"56a6a12a-50fb-44e1-8b08-7b2e1d8968a7","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.823746Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d15e350fe9f1820d35f9a905180390101a3c2b438089c05f1729ebdc075dfb62","observation_id":"edcf64a5-0810-4c24-a6e8-afa7a4f859d0","resolution":{"observed_at":"2026-08-08T13:29:11.635880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.615042Z","title":"Smiles, a chemical language and information system","venue":null,"work_id":"47853606-fca9-4e0f-a069-ac025f168a3a","year":1988},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.829086Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:994d9a1ed348162c3819b780c3dda3ee5914da64cdd049c3ac0a83e8e7dc5821","observation_id":"f994b61a-7269-49dd-8090-b8f1ec351a08","resolution":{"observed_at":"2026-08-08T13:29:11.619981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.599759Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"38e50b32-d59f-4475-8e40-3f28c51b87dc","year":1992},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.833793Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:ae4f268fe921d86f9dd5e5814a41ce2e38e390fca422290901812e706b979ef7","observation_id":"8b7c7211-8225-4e6a-b98a-6183fba0b0d5","resolution":{"observed_at":"2026-08-08T13:29:11.604580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10862","last_updated":"2021-09-27T21:12:49Z","snapshot_observed_at":"2026-08-04T13:56:39.444746Z","submitted_at":"2021-09-22T17:34:18Z","title":"Recursively Summarizing Books with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10862","snapshot_observed_at":"2026-08-08T13:29:10.838714Z","title":"Recursively summarizing books with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.838714Z"},"links":{"cited_paper":"/paper/2109.10862","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:f8793c8111f98401a0296b30c1d57c7a678e74e62661caf4e3061b7ce6a134d9","observation_id":"58fa5c6a-c918-4eaa-9ef0-b8dc150444d3","resolution":{"observed_at":"2026-08-08T13:29:10.838714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.583656Z","title":"Rlcg: When reinforce- ment learning meets coarse graining","venue":null,"work_id":"43fc72ae-c486-4243-b80c-e1597fa1030c","year":2022},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.844060Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:1a878c31e8919ed1bd0b7494a2b7f3c1299141cec5e7efc813d7b0fa255a92fb","observation_id":"af742400-5b96-4b63-823e-c8c6b4b59aca","resolution":{"observed_at":"2026-08-08T13:29:11.588909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.13015","last_updated":"2019-11-22T03:06:41Z","snapshot_observed_at":"2026-08-06T01:18:31.633785Z","submitted_at":"2019-04-30T02:03:05Z","title":"Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.13015","snapshot_observed_at":"2026-08-08T13:29:10.848704Z","title":"Towards coherent and engaging spoken dialog response generation using automatic conversation evaluators","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.848704Z"},"links":{"cited_paper":"/paper/1904.13015","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:c63cef503f36e81afbd7feed7036f98b9ed62e22f83b112f094614885dc26c5f","observation_id":"dba36a93-4910-49b2-9b99-285bbd402e00","resolution":{"observed_at":"2026-08-08T13:29:10.848704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.566915Z","title":"Population-based de novo molecule generation, using grammatical evolution","venue":null,"work_id":"052cb079-cca4-4368-8eef-1570d007b5df","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.854230Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:17ca712c15e9b59b5f8a147ed9544ed0963b311075cc0c08a6a9113178ecce1b","observation_id":"a1231f94-5d75-4426-8925-59a0c3e6d2bc","resolution":{"observed_at":"2026-08-08T13:29:11.572547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.550422Z","title":"Graph convolutional policy network for goal-directed molecular graph generation","venue":null,"work_id":"61948d90-e933-473d-ae26-3e4b61c970eb","year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.858943Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:35d6dedca76bfe94afff5ac14c4131374373349a969ecf5ba42e6ed4a4876d47","observation_id":"45f5e9b4-6aea-412f-9781-7ea6f37df6f9","resolution":{"observed_at":"2026-08-08T13:29:11.555221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.534414Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"7644dc0f-32b8-457d-9b89-55d41a11df4b","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.863986Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:62769ba0c5501c393619fcd8ac67a4d6f2a7c5a3cd861968517647a0726b030c","observation_id":"3ebf7b5d-0ca2-4611-99a3-a929bb3607b9","resolution":{"observed_at":"2026-08-08T13:29:11.539385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-04T23:38:14.844517Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-08T13:29:10.869139Z","title":"Rrhf: Rank responses to align language models with human feedback without tears","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.869139Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:742636038237e6f5fcd2cc96b35b1e9f749097e5ef3096836d795a67b083ab1c","observation_id":"0959e6bb-b69f-4519-b139-d1afefd35b8d","resolution":{"observed_at":"2026-08-08T13:29:10.869139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.518657Z","title":"Covid-19 pathophysiology: A review","venue":null,"work_id":"5a4b4ba5-ecd5-4c64-b773-ffd05a2894d5","year":2020},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.874390Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:873b81f7ce6706d1e23d2df979abd1757d2987213b47101f368c854fda24f00c","observation_id":"910f057e-941d-4419-be53-bfbc0764eb8d","resolution":{"observed_at":"2026-08-08T13:29:11.523296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.502736Z","title":"Universal approach to de novo drug design for target proteins using deep reinforcement learning","venue":null,"work_id":"bde299fb-846b-4e27-9469-3c3ac7b24d6f","year":2023},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.879206Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:2725cc92203cb23fcec52b51d91abf7957879e2cfc6a4e1953944a8b147af437","observation_id":"3e9b7808-5ea1-409d-92de-313d0a645cb9","resolution":{"observed_at":"2026-08-08T13:29:11.508183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:29:11.486403Z","title":"Optimization of molecules via deep reinforcement learning","venue":null,"work_id":"62821be3-4f27-44f4-9f1d-5a2ea2068e31","year":2019},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.884009Z"},"links":{"citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:d86d2315c8909ad018d03245b5124f145726669beabd4703d386d79e9ce43e30","observation_id":"eef72f93-4f95-40c2-8916-4eb13c4799fc","resolution":{"observed_at":"2026-08-08T13:29:11.491284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T13:29:10.888735Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.888735Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:85948e8cd45f33b87c785f4f82ec8f84ca0033d2d0ee24ec9719207c546f12c0","observation_id":"b5fe6846-2656-4838-8bc3-70065bc8adff","resolution":{"observed_at":"2026-08-08T13:29:10.888735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T13:20:51.144044Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237."}