Pith. sign in

Paper Citation Record · LEDGER

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization

As of 9 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07237 v1

Coverage vector

measured 88 of 88 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T13:29:10.888735Z

measured 88 of 88 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

88 of 88 outbound references displayed

  • verified exact2
  • verified fuzzy54
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 23139c04-27bb-4f7e-813b-580216ed1d9f · outbound

This paper cites De novo drug design using reinforcement learning with graph-based deep generative models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization De novo drug design using reinforcement learning with graph-based deep generative models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.451377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.451377Z digest=sha256:47817f7c860153dc46e5867e46534034250bb9111edcf194c3372e15729bc551

Observation 9d0e9410-cafb-4473-8484-46ad1e2101fb · outbound

This paper cites DrugCentral 2023 extends human clinical data and integrates veterinary drugs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DrugCentral 2023 extends human clinical data and integrates veterinary drugs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.456789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.456789Z digest=sha256:d3913bd8d361d1a1d1db09a5ec54a7cd3b7378f116e196f704b2421b93fce0f2

Observation 094e99f4-dcb2-4b13-bcd7-7b6683564a28 · outbound

This paper cites MolGPT: Molecular generation using a transformer-decoder model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization MolGPT: Molecular generation using a transformer-decoder model

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.461807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.461807Z digest=sha256:52d74cb83c47726c6cca9907bce3fd0009ca925a330f4fa66b168847c43b8b1c

Observation ccb5f472-fa15-445f-bb50-8fa447178299 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.467246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.467246Z digest=sha256:28ba2f91ed3dd58f19ecab0154de00e38442def1c7bdd7539b0b041ebadff934

Observation 82d291ee-f4ce-4ba9-b9d1-b0baf5213678 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Constitutional AI: Harmlessness from AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.472852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.472852Z digest=sha256:3abb477c9d9009527f96beb3a468d93517511293a0497071a28906d60fbd7eaa

Observation 1fb99ddb-7d6c-4982-8791-c187bf18704c · outbound

This paper cites Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.478424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.478424Z digest=sha256:cdca9da089c7911429cdabd54b509177029f3c8f400be52d34ee7c6361c4b7a6

Observation 8cec44a0-b99d-494d-894c-40502357271f · outbound

This paper cites Molecular similarity: a key technique in molecular informatics.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular similarity: a key technique in molecular informatics

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.483408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.483408Z digest=sha256:e7ce2371fee580436d7688894acfb47946e02a0c053ffa16d5c0a8b7c3ae82be

Observation 908a204e-7b65-4486-828e-6f67e9028956 · outbound

This paper cites Better Rewards Yield Better Summaries: Learning to Summarise Without References.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Better Rewards Yield Better Summaries: Learning to Summarise Without References

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.488851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.488851Z digest=sha256:ad432ae03b3e6157ee94f0d8e020f4088e59347ffa6c4229b18884f8f1b3c18c

Observation 36739dfb-d947-46c7-a108-9d1f8d560c50 · outbound

This paper cites Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.493944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.493944Z digest=sha256:ecb118ac6b076d00ef06f31a6d5c5b71668d46b9d4e4af905a8770d034a2d890

Observation 0a097645-0b34-49a0-99ab-973421e42fee · outbound

This paper cites Transformers and Large Language Models for Chemistry and Drug Discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformers and Large Language Models for Chemistry and Drug Discovery

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.423383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.498827Z digest=sha256:4ac0f7aceb0d7795fe47cd85165fe35b1240fc57348a598bbab55f07203fb5d4

Observation 6a5f96de-cb61-450e-bbcb-094a52ef9aaf · outbound

This paper cites Offline rl without off-policy evaluation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Offline rl without off-policy evaluation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.504287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.504287Z digest=sha256:8bee61c23b54493c74646514989973125afd745add29787fd235f14bca18e2b6

Observation f5663653-79bf-4e7d-83ff-f771d6600718 · outbound

This paper cites Safe learning in robotics: From learning-based control to safe reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Safe learning in robotics: From learning-based control to safe reinforcement learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.509689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.509689Z digest=sha256:6d75c982dd5d4957eee0fd71c08a446ffcaf5f761ec5e4de41ec5bcaa2db612a

Observation b206893b-d305-46af-9ba2-a6d27ec1fd6e · outbound

This paper cites Policy improvement via imitation of multiple oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy improvement via imitation of multiple oracles

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.326377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.514629Z digest=sha256:9b34dd42819306d1adddffbe4729f114aed99247ebfd9a07d0aafdd386876fb4

Observation ffe4e10b-1f35-416f-9024-d5175ba07ca6 · outbound

This paper cites Deep reinforcement learning from human preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning from human preferences

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.310763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.519703Z digest=sha256:a5fda0f5eeb21749b3544574d20b9ab4bc9f28fc6c4f13ae202f27d08fbf5f58

Observation 6d6b85ae-ff03-40d4-8545-30fe36030596 · outbound

This paper cites Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.295680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.524690Z digest=sha256:496987d500b92be566868ab7cc8777e658dcdd892499a09bfe4a5ae769d88a9c

Observation f8011063-e22b-4fe0-b4c1-f863cc232dce · outbound

This paper cites The cost of new drug discovery and development.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The cost of new drug discovery and development

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.280350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.529941Z digest=sha256:cae2865b74b81e6d76c3354afc012a40c593084029d13dc6efa682dad2bf1ec0

Observation 6408ef31-5451-4b82-9dd6-5bc38750038f · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.536482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.536482Z digest=sha256:74ef541fb8cde93c9265ac0ab6a714266008b2ffd9e6af851eb39c1b9f3f37da

Observation dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc · outbound

This paper cites Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.264876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.541731Z digest=sha256:6741e80915f38496f534b9113b8296da5ee802525da2b16a1b75572dd93220bb

Observation e225d3ef-bfcd-48bb-a2cc-4e3f05adb878 · outbound

This paper cites Neural scaling of deep chemical models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural scaling of deep chemical models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.249858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.546660Z digest=sha256:5183a5f00d78b30832f7a7f3e80ca58c40fd920adfedfbd5b3abaa579a4be493

Observation 99205759-fa1f-4eba-8e4d-fd3042074733 · outbound

This paper cites Mimosa: Multi-constraint molecule sampling for molecule optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Mimosa: Multi-constraint molecule sampling for molecule optimization

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.234419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.551668Z digest=sha256:76edb0eea1c039a4fb209f381d14f09c60940b73c7fa4c06f9dcb77aaf0081b7

Observation 4a7f36a5-e36b-4f42-b179-3ffa4f7b6085 · outbound

This paper cites A new algorithm for data compression.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A new algorithm for data compression

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.218993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.556435Z digest=sha256:2a1f6e26525d92f1076952cffb71bda1976d8a50ea5b6bff549d5ccebced985f

Observation b376e5c0-8b05-4431-ad25-18d3f51c0417 · outbound

This paper cites Scaling laws for reward model overoptimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scaling laws for reward model overoptimization

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.203370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.561585Z digest=sha256:f6ee65b6df915e6ab6eacae0eb2bcaa565bcc52d0ba056c92f42ee74e8d11a21

Observation e21d29d2-23bd-4f8d-906e-1ae1ef185db7 · outbound

This paper cites Learning to navigate the synthetically accessible chemical space using reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to navigate the synthetically accessible chemical space using reinforcement learning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.187597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.566706Z digest=sha256:8d307f385abee88d84df6fd12a7e38d1ac14097331dbde1bfefc04cda3dc23e1

Observation d32b5402-a510-45ef-b87b-616781316bb6 · outbound

This paper cites Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.571560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.571560Z digest=sha256:6ddcd5a2fcfc32b1c6f46e1a7641b99c3bb5325819a29a9997f42d150679f7bc

Observation b7304e96-c6e4-4c95-91ca-e36e862cec1b · outbound

This paper cites Covid-19 vaccines and variants of concern: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 vaccines and variants of concern: A review

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.172238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.576746Z digest=sha256:b411991e38e46286cbb7c61ca703e477a66399203c47925b6bda5bf468818ed1

Observation 0e52c434-b836-469b-ab68-9ec432686a76 · outbound

This paper cites Learning from Dialogue after Deployment: Feed Yourself, Chatbot!.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning from Dialogue after Deployment: Feed Yourself, Chatbot!

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.581537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.581537Z digest=sha256:aa4c261304a28e7eafb0da651ace69ef63679ed15d732b1dca1cb91252eccc7c

Observation 114d79ca-e711-4826-a1ba-021da26e1722 · outbound

This paper cites Molecular optimization by capturing chemist’s intuition using deep neural networks.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular optimization by capturing chemist’s intuition using deep neural networks

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.156432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.587407Z digest=sha256:4e463e2e8850974ffbfc2aee2ff90e559f6afb55c8cd9a3cd63121e548dad94b

Observation dde8d5c8-2416-45be-b872-05cb4270c05b · outbound

This paper cites Transformer-based molecular optimization beyond matched molecular pairs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformer-based molecular optimization beyond matched molecular pairs

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.141145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.592697Z digest=sha256:caf8aacc2bd1d7fb489a743a46337a471b6a533e628844d25260938f948eee62

Observation 5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3 · outbound

This paper cites Reward learning from human preferences and demonstrations in atari.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reward learning from human preferences and demonstrations in atari

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.126101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.597480Z digest=sha256:2980fdff2221b325b2460c9d90b1f7559b22a909dd9cc5a56c86c008909913c7

Observation ae7472bf-2b7d-46c6-8e9a-b17704c9eefa · outbound

This paper cites The distribution of the flora in the alpine zone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The distribution of the flora in the alpine zone

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.111431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.601947Z digest=sha256:90ac4a1d8f9bf8b475a0e411aa8ef29f8d6949e1b5b1ec84d8610f2459c7f24d

Observation aa297f5a-ade7-4a7d-b120-6cebc83fd29e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.606901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.606901Z digest=sha256:a5deda233786ce72c5b70ffdb97675e7b3ccac4ae5a556cd49572c7f991ed3bc

Observation fece7bd0-12ae-4d39-b813-073e94735335 · outbound

This paper cites A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.096586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.612042Z digest=sha256:aa0ace3f35670ebc49e45742cd4d5cb19b4dce03ae29c1f92887bcdb9c1c01ec

Observation 9d3aabbc-ec55-47f2-a8b1-249e90dd010c · outbound

This paper cites Multi-objective molecule generation using interpretable substructures.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Multi-objective molecule generation using interpretable substructures

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.081061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.616638Z digest=sha256:fc85ccf046598431799bf52487309666c637bd9f1300bdeb44286c8624e7fc73

Observation cb0cd3ed-101b-4b17-afec-2b76042e4c5b · outbound

This paper cites Posit: flexible shape-guided docking for pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Posit: flexible shape-guided docking for pose prediction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.065686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.621388Z digest=sha256:5be9f4d68bcc368f8846b9a6baadb43d2d4194008b4f003001f26666d6baeccd

Observation a001709c-5cf6-4e19-b714-4d43d8d6c97e · outbound

This paper cites Giraffe: Using Deep Reinforcement Learning to Play Chess.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Giraffe: Using Deep Reinforcement Learning to Play Chess

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.626000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.626000Z digest=sha256:edf1c7a76b01d534f4f5766168298b2f09692f41e70cfef5533d73d7852b9abf

Observation c7eed6fe-8191-457f-afc1-e099f4c25882 · outbound

This paper cites RDkit: Open-source cheminformatics software.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RDkit: Open-source cheminformatics software

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.050462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.631332Z digest=sha256:8a9f82a54e7035effff256ed68138a43ff1694359483b48dd06e625178425bd3

Observation 7a663836-d1df-4baa-96fd-3b8c2d7ed932 · outbound

This paper cites Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.034338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.635987Z digest=sha256:3b4645eed378f7b3725af8ffb14acb00c6ffe5d98f779029c59420bd5b376c46

Observation f8dccded-8c51-48f6-b699-731479c7493b · outbound

This paper cites Scalable agent alignment via reward modeling: a research direction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scalable agent alignment via reward modeling: a research direction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.640998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.640998Z digest=sha256:9ba987f0a3d1a93683236bd63c1d8ea8b193eed14a869ae0fdf774046412ecf4

Observation 1a7dd7a7-bef0-403e-a139-deb71922ae6e · outbound

This paper cites Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.018940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.646464Z digest=sha256:31af4b193207d82feadda487aa5fcf526d0d096f64743e6f8abbff4501f6b97d

Observation 45814632-f5bc-4067-a44e-6ebf4a9eda45 · outbound

This paper cites Blending Imitation and Reinforcement Learning for Robust Policy Improvement.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Blending Imitation and Reinforcement Learning for Robust Policy Improvement

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.651020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.651020Z digest=sha256:49e188adca2edfdf5168ff9d427b92c532116d4b853d0fd9609a8f0bcb52f602

Observation d68f1ad5-5c2d-4a3e-9463-91497975427c · outbound

This paper cites Active policy improvement from multiple black-box oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Active policy improvement from multiple black-box oracles

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.002550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.655982Z digest=sha256:b21c7620731f026d550966bb91d6be1b21411ef4345459ef4b391bb623baa7fc

Observation cbe878d8-589b-4a63-930d-8bb6f217e96f · outbound

This paper cites Entropy-reinforced planning with large language models for de novo drug discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Entropy-reinforced planning with large language models for de novo drug discovery

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.987215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.660687Z digest=sha256:56bf77e7c21cab2775f828045339ec87b57662a47fa3f6f931ad00a811175264

Observation abe3419c-4ce9-4b80-b31d-9602a5d27bf9 · outbound

This paper cites Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.972163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.665499Z digest=sha256:08d3b08ca7874e3c532944ce76a741330da9fc9d941b184728c4eac06253ba9b

Observation f23e3ed9-0fd9-432a-96a1-000f1f2be132 · outbound

This paper cites Reinvent 4: Modern ai–driven generative molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinvent 4: Modern ai–driven generative molecule design

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.956432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.670541Z digest=sha256:99b1db35d1d3a9fe1cf52d14dd0f3751b7852ebbe13fca0546dd5fe0e64aaf70

Observation 92dd2be8-1865-48ae-946d-fe2f337ae38d · outbound

This paper cites The different mechanisms of cancer drug resistance: a brief review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The different mechanisms of cancer drug resistance: a brief review

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.941167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.675183Z digest=sha256:6c37895396ceab9d173b8738dce0cb39e108ce753784df08f2928dee65dfbd3f

Observation e480c6e2-d2ed-4c25-b705-2a498bc9e1ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Playing Atari with Deep Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.679677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.679677Z digest=sha256:bcf6adbf8d79012aca3059e6dc12c3689823430a5ce4c664b91dba81f450dc07

Observation 338e75be-78b2-4fd9-b61d-457709dea35e · outbound

This paper cites Exploring deep recurrent models with reinforcement learning for molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Exploring deep recurrent models with reinforcement learning for molecule design

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.926339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.684720Z digest=sha256:885a98ba3bea1a6a80b0a1dd44bb6f2b6250f9a3ad59274a042c7916d7ba621c

Observation b4507f40-8c05-4b63-893c-b8f11b8e39df · outbound

This paper cites Molecular de-novo design through deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular de-novo design through deep reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.911596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.689475Z digest=sha256:d13a18b04eba67cbad278386d98418bb3b8910c0986aa2c3a95b15fc7086de32

Observation 63ed8f5a-6c28-4931-880e-9b09de5fc5cb · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.694293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.694293Z digest=sha256:cb24853b758a726261aa51a3d9a45350364c796cf592fbea13fac783c7f0ec31

Observation 05bb62f3-110c-4816-afd9-60a17d77301a · outbound

This paper cites Combinatorial enumeration of groups, graphs, and chemical compounds.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Combinatorial enumeration of groups, graphs, and chemical compounds

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.897575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.699598Z digest=sha256:c6e004d7de3d769deb2e9b3e4802b3f7501ce5f5056e929da32922c12bcc85b3

Observation 324daebc-83d2-460e-9377-5d455a92e951 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Alvinn: An autonomous land vehicle in a neural network

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.883398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.704511Z digest=sha256:d2baabdf86975111488a66506cbe3bc966578fa0ecb23998d7439b45f81c2073

Observation 04c6d37d-e073-472f-8d33-a72063f62fd4 · outbound

This paper cites Deep reinforcement learning for de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for de novo drug design

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.868339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.709787Z digest=sha256:b7664b9e9b1ec000bba7967377e23d7bb548fb15766d5e5f660aa2021636bb42

Observation 6360c346-a16e-4542-b7ff-68aeffca25f5 · outbound

This paper cites Drug repurposing: Progress, challenges and recommendations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drug repurposing: Progress, challenges and recommendations

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.853447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.714625Z digest=sha256:8384bdbf06952038d614b75450a09821deb325750d51a3877f726f51978778ad

Observation 82924bfc-aaeb-4363-9c18-367187623f97 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.719469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.719469Z digest=sha256:c0763f656714debb51acbfc46c36533aa9c978d1af25f96b146e6e91ac06e9ac

Observation e6274477-7f12-4eb8-8b7f-b78cc1b06e12 · outbound

This paper cites Learning by playing solving sparse reward tasks from scratch.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning by playing solving sparse reward tasks from scratch

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.838474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.724522Z digest=sha256:14a158540e7f83b42b79146e1e2d2b5052001d94cce760d78d0d14e778356c79

Observation 9cf7afa3-b90c-453f-9ab1-185431ee459f · outbound

This paper cites Extended-connectivity fingerprints.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Extended-connectivity fingerprints

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.822920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.728977Z digest=sha256:bccd95d0dd74ccb8dc1c48f08d4f4eb5c43cc2aa95cba8f61889bf6542a82c9a

Observation 923c1ada-3d19-43c8-bf55-60a20962d984 · outbound

This paper cites Reinforcement and Imitation Learning via Interactive No-Regret Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement and Imitation Learning via Interactive No-Regret Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.733657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.733657Z digest=sha256:2e412238a895a2d87a506580d55f5350597a579b8cf1cef4998a92c1bca4b368

Observation 0f3302b8-5f07-40e5-a7e3-74df4faaa6cd · outbound

This paper cites A reduction of imitation learning and structured prediction to no-regret online learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reduction of imitation learning and structured prediction to no-regret online learning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.807028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.738675Z digest=sha256:6e7d97964d766e73e78ba0695c8ab6e342387b1ba538c7156ba404de2e849d63

Observation 08c26f04-fe45-446c-bb7e-c8d7bbe3b902 · outbound

This paper cites C5T5: Controllable Generation of Organic Molecules with Transformers.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization C5T5: Controllable Generation of Organic Molecules with Transformers

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.090606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.743339Z digest=sha256:35389397c3e891b86122a346f05a983b9edacb08b197f8e77f3d4d056e5d34c9

Observation e17aae1f-ad39-4e19-ad42-6afc84602047 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural Machine Translation of Rare Words with Subword Units

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.748664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.748664Z digest=sha256:92cb624f43cd8f36b26729d4f522cc12021258e0318aff2bbfb06fde863950ca

Observation 5178c9a0-2e29-46b7-b83a-c5196241925f · outbound

This paper cites Preference Ranking Optimization for Human Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Preference Ranking Optimization for Human Alignment

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.753720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.753720Z digest=sha256:4dfd63fb4ae1c1d61caa6d107fcc3db7ce66e39e51e4e06bb77157e45bd49e16

Observation 10823088-7042-4c39-b78c-4c9fde3ca91f · outbound

This paper cites Deep reinforcement learning for multiparameter optimization in de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for multiparameter optimization in de novo drug design

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.790337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.758864Z digest=sha256:2324b4171e281e1704969a6fc6508560c5bf151c8770e6a5dc7141f916d6a341

Observation 37ee144e-2f30-4b2f-b5af-21356c0f20be · outbound

This paper cites ZINC15–ligand discovery for everyone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization ZINC15–ligand discovery for everyone

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.774076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.763559Z digest=sha256:6e8a4e2ba09053ddf4da29597690d7a666b037cdaa946d364ee2dfa45d41ef0e

Observation 44a38208-e0ec-4566-a5d4-4d44c5fc3455 · outbound

This paper cites Learning to summarize with human feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to summarize with human feedback

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.758229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.768526Z digest=sha256:bd47f89d064afb87b6f8ca35e4020be1557bd1f5d31d5ec4ba1e324f13ee1ad4

Observation 15067d09-f0c6-4d66-9de7-7883d3521f85 · outbound

This paper cites Molsearch: search-based multi-objective molecular generation and property optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molsearch: search-based multi-objective molecular generation and property optimization

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.742320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.773329Z digest=sha256:e16d2a936547239f0da20812e5a8200f494a7f72cd6e69cfff554e05cd83709c

Observation 469feec5-13f5-47f2-8e77-8d19c8129579 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy gradient meth- ods for reinforcement learning with function approximation

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.726293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.778406Z digest=sha256:03543b0a40264c8e5b0d556e24a6e0589af914002a060e5aa6689e635100b446

Observation d3e42ab1-d33a-4709-affb-8a0690452915 · outbound

This paper cites Reinforcement learning for systems pharmacology-oriented and personalized drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement learning for systems pharmacology-oriented and personalized drug design

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.711259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.783054Z digest=sha256:29738d5ef6c8ef84c67eaa469e96b257e54594f138b741c5388ea3f3e7e59407

Observation 202f7111-55b2-412c-a7ae-549f1931acfe · outbound

This paper cites Drlinker: Deep reinforcement learning for optimization in fragment linking design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drlinker: Deep reinforcement learning for optimization in fragment linking design

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.694766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.788037Z digest=sha256:ddfb2150b9a3a26a784b1920ed1b48aa2ad675f95237d5360686e75890b4225f

Observation e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc · outbound

This paper cites DeepMind Control Suite.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DeepMind Control Suite

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.793596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.793596Z digest=sha256:73385f6421b51bafe46fcdcbf369b1fb98b8ce438ca9c719984c4d5cd9b6912a

Observation 40b71e8d-b632-4ee5-9a72-464d617a31a7 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.799215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.799215Z digest=sha256:e29f6f09ab100b46dd21f2fde71ce82d6532346ae0568b14fa546d0e7a5a12e6

Observation fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0 · outbound

This paper cites Matched molecular pair analysis in short: algorithms, applications and limitations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Matched molecular pair analysis in short: algorithms, applications and limitations

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.678824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.804399Z digest=sha256:38a7d3018b538fbacc22169b47db7f4c0ab9c8e63c813b1153b100abe07b0a28

Observation 9a8ed734-2a4a-471a-84c4-28b01a56a7cc · outbound

This paper cites Benchmarking language-based docking models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Benchmarking language-based docking models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.662679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.809172Z digest=sha256:43be8fdefff87848c0cd9400d91af92aae5798ade62ebc2d7918063392058abe

Observation 8bf24568-87e4-47ae-9c4b-bf637c89ade6 · outbound

This paper cites Attention is all you need.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Attention is all you need

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.813976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.813976Z digest=sha256:6db1b1ded30be7a01321aa9b5ef2cfadbe4908c9252faa06a2d1afe596f80dbc

Observation 52f6e24d-3e2b-4499-baeb-dc4bc2aab748 · outbound

This paper cites Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.818690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.818690Z digest=sha256:06c69dc70bc4743210bbaef9a2635c556a7a3d4ef952dffa0fa6068151de01df

Observation edcf64a5-0810-4c24-a6e8-afa7a4f859d0 · outbound

This paper cites A reinforcement learning approach for protein–ligand binding pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reinforcement learning approach for protein–ligand binding pose prediction

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.635880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.823746Z digest=sha256:eb98eeaad0f7895e8429476544ec0f639fe8babaf98651737ff20cb6c1e3db8f

Observation f994b61a-7269-49dd-8090-b8f1ec351a08 · outbound

This paper cites Smiles, a chemical language and information system.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Smiles, a chemical language and information system

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.619981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.829086Z digest=sha256:4e961fe76134673c38966797a1f20cbba66fd45542a10a681cf08f8a2b90f962

Observation 8b7c7211-8225-4e6a-b98a-6183fba0b0d5 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.604580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.833793Z digest=sha256:915efed2d7f2895f6f391d08746fe775ec3d9a445f07114925cdcac6b7e06699

Observation 58fa5c6a-c918-4eaa-9ef0-b8dc150444d3 · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Recursively Summarizing Books with Human Feedback

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.838714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.838714Z digest=sha256:df8cea8bca0f59019e49dc6742584e8b5bcf80386d10417839d2f76e6e3d35ef

Observation af742400-5b96-4b63-823e-c8c6b4b59aca · outbound

This paper cites Rlcg: When reinforce- ment learning meets coarse graining.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rlcg: When reinforce- ment learning meets coarse graining

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.588909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.844060Z digest=sha256:25d84dc7f4345649ab923ab48e1453d692bda5544f712cd33e6d599bf6a59b20

Observation dba36a93-4910-49b2-9b99-285bbd402e00 · outbound

This paper cites Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.848704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.848704Z digest=sha256:b9af566433765c65378c9cbce0cd012a785b9790c5db2e06f9b31f0bbabacd85

Observation a1231f94-5d75-4426-8925-59a0c3e6d2bc · outbound

This paper cites Population-based de novo molecule generation, using grammatical evolution.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Population-based de novo molecule generation, using grammatical evolution

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.572547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.854230Z digest=sha256:8696a39d25f7fd19454a32e9551333425c62620e994ece559e8ab9674fc5b7b1

Observation 45f5e9b4-6aea-412f-9781-7ea6f37df6f9 · outbound

This paper cites Graph convolutional policy network for goal-directed molecular graph generation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Graph convolutional policy network for goal-directed molecular graph generation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.555221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.858943Z digest=sha256:4f30582c43b5f5e16640df27e2509a277584b23b62e8148e768bd405ea56bafc

Observation 3ebf7b5d-0ca2-4611-99a3-a929bb3607b9 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.539385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.863986Z digest=sha256:26f624afbaba279962180d2a71932208d1263259b7610356c0b58ae3d3abd6c8

Observation 0959e6bb-b69f-4519-b139-d1afefd35b8d · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.869139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.869139Z digest=sha256:f9cd707f0a9a764fb6386368631e89a7459f7b0ac5a023fc31f83652d25783de

Observation 910f057e-941d-4419-be53-bfbc0764eb8d · outbound

This paper cites Covid-19 pathophysiology: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 pathophysiology: A review

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.523296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.874390Z digest=sha256:2d863dfa864538d9292a2f35758797a2fc40ec6ae9fcaacdcaaaffbb16d69442

Observation 3e9b7808-5ea1-409d-92de-313d0a645cb9 · outbound

This paper cites Universal approach to de novo drug design for target proteins using deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Universal approach to de novo drug design for target proteins using deep reinforcement learning

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.508183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.879206Z digest=sha256:ab1e786a4c0aeacda3847e7e1b0b5385b44859ef583d7965960e4dc523277572

Observation eef72f93-4f95-40c2-8916-4eb13c4799fc · outbound

This paper cites Optimization of molecules via deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Optimization of molecules via deep reinforcement learning

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.491284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.884009Z digest=sha256:38beac8f7c3310b4ae634f07e56668ced41e366558b645ded3bf2a9f7e398cb8

Observation b5fe6846-2656-4838-8bc3-70065bc8adff · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Fine-Tuning Language Models from Human Preferences

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.888735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.888735Z digest=sha256:7b70e2279ff3cacbc3a06d474d75ee8cda816bc4738953bcafce19ee476ec75d

Pith citing papers

No inbound Pith citation observations are available.