Pith. sign in

Paper Citation Record · LEDGER

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization

As of 8 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2502.07237.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07237 v1

Coverage vector

measured 88 of 88 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T13:29:10.888735Z

measured 88 of 88 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

88 of 88 outbound references displayed

  • verified exact2
  • verified fuzzy54
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 23139c04-27bb-4f7e-813b-580216ed1d9f · outbound

This paper cites De novo drug design using reinforcement learning with graph-based deep generative models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization De novo drug design using reinforcement learning with graph-based deep generative models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.451377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.451377Z digest=sha256:b242879fce5f36f9758ff3aa6edb912453e585248052873674995fe3a4fc520a

Observation 9d0e9410-cafb-4473-8484-46ad1e2101fb · outbound

This paper cites DrugCentral 2023 extends human clinical data and integrates veterinary drugs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DrugCentral 2023 extends human clinical data and integrates veterinary drugs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.456789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.456789Z digest=sha256:885f41c091dfde37c3a77a5c5ce676a26d5feedd0b2df3b5c9caa7bd66a029de

Observation 094e99f4-dcb2-4b13-bcd7-7b6683564a28 · outbound

This paper cites MolGPT: Molecular generation using a transformer-decoder model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization MolGPT: Molecular generation using a transformer-decoder model

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.461807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.461807Z digest=sha256:b5a022ea8e32d0d78c05621676bf2b82259192e6cf3ca69e8116f840cc2d1fae

Observation ccb5f472-fa15-445f-bb50-8fa447178299 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.467246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.467246Z digest=sha256:ab488451aac77edcc94cc3bd5e608b282d1948df539b8b9db7180bbe1b8a18ef

Observation 82d291ee-f4ce-4ba9-b9d1-b0baf5213678 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Constitutional AI: Harmlessness from AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.472852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.472852Z digest=sha256:964f0c95c065f311646318536124c160727aeeecd1830d862de2ca9dd811313b

Observation 1fb99ddb-7d6c-4982-8791-c187bf18704c · outbound

This paper cites Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Why is tanimoto index an appropriate choice for fingerprint-based similarity calculations? Journal of cheminformatics, 7:1–13, 2015

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.478424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.478424Z digest=sha256:a274d7b4e84540617a4fb33bbd087d5bf401cc905d476264a994e3c0848eee7e

Observation 8cec44a0-b99d-494d-894c-40502357271f · outbound

This paper cites Molecular similarity: a key technique in molecular informatics.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular similarity: a key technique in molecular informatics

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.483408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.483408Z digest=sha256:bcaee7c5139ef5c801f110ad22b1b6b8aff281f010ef912582ee89440557a920

Observation 908a204e-7b65-4486-828e-6f67e9028956 · outbound

This paper cites Better Rewards Yield Better Summaries: Learning to Summarise Without References.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Better Rewards Yield Better Summaries: Learning to Summarise Without References

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.488851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.488851Z digest=sha256:12c609437da190950075cb4d29b631df7e1de87f14f6a3634bf4c497ea0f1446

Observation 36739dfb-d947-46c7-a108-9d1f8d560c50 · outbound

This paper cites Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Paccmannrl: De novo generation of hit-like anticancer molecules from transcriptomic data via reinforcement learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.493944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.493944Z digest=sha256:0ad0c46ca2738588942f1722c5f221df5a16c8863a3859ca2d95d8b19aedf6ad

Observation 0a097645-0b34-49a0-99ab-973421e42fee · outbound

This paper cites Transformers and Large Language Models for Chemistry and Drug Discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformers and Large Language Models for Chemistry and Drug Discovery

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.423383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.498827Z digest=sha256:753d5cba9057e10d511c69a5a7c7e232018b4032ce4eef1030b029e12876b930

Observation 6a5f96de-cb61-450e-bbcb-094a52ef9aaf · outbound

This paper cites Offline rl without off-policy evaluation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Offline rl without off-policy evaluation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.504287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.504287Z digest=sha256:aac17c63d5da4c5280928ea8f2398ad78f06b888e7c5779e9a1a666f0a859295

Observation f5663653-79bf-4e7d-83ff-f771d6600718 · outbound

This paper cites Safe learning in robotics: From learning-based control to safe reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Safe learning in robotics: From learning-based control to safe reinforcement learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.509689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.509689Z digest=sha256:b6383d5eb2117c507c3bceed84a02c65979bea03683cb8740197ab8092f461cd

Observation b206893b-d305-46af-9ba2-a6d27ec1fd6e · outbound

This paper cites Policy improvement via imitation of multiple oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy improvement via imitation of multiple oracles

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.326377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.514629Z digest=sha256:0f75f0e9e4c6bac274c5d5e9563264eec841b30488b631ba04d2ba89647cee16

Observation ffe4e10b-1f35-416f-9024-d5175ba07ca6 · outbound

This paper cites Deep reinforcement learning from human preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning from human preferences

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.310763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.519703Z digest=sha256:f8f9a4a942224d59664d025905551aa3603bc36f0b66497e4519b6f711fef418

Observation 6d6b85ae-ff03-40d4-8545-30fe36030596 · outbound

This paper cites Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Ai-accelerated protein-ligand docking for sars-cov-2 is 100-fold faster with no significant change in detection

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.295680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.524690Z digest=sha256:4911cad879e3ec75a4489b9947de206ba503551bb77316fdd83984a03eafb481

Observation f8011063-e22b-4fe0-b4c1-f863cc232dce · outbound

This paper cites The cost of new drug discovery and development.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The cost of new drug discovery and development

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.280350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.529941Z digest=sha256:f32f3ffb9f90335e96709a15ad87dab27b47f4cf2753662649fab85c39b2b490

Observation 6408ef31-5451-4b82-9dd6-5bc38750038f · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.536482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.536482Z digest=sha256:9eb042a58dedb0995103bd8e88a1edd14e562079f184a4394f11f89433d4708f

Observation dbbe1424-7a55-4100-9f5e-7cd3bad2a6dc · outbound

This paper cites Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Estimation of synthetic accessibility score of drug-like molecules based on molecular complexity and fragment contributions

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.264876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.541731Z digest=sha256:e26bd4e850f4d8ee4e95e5a52de6f8057239ab821c0e2451ab646dcc911c7b49

Observation e225d3ef-bfcd-48bb-a2cc-4e3f05adb878 · outbound

This paper cites Neural scaling of deep chemical models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural scaling of deep chemical models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.249858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.546660Z digest=sha256:9a2c8e746a98cdfd8513015ab094a3aa43429b47d4b433743e702c3225825894

Observation 99205759-fa1f-4eba-8e4d-fd3042074733 · outbound

This paper cites Mimosa: Multi-constraint molecule sampling for molecule optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Mimosa: Multi-constraint molecule sampling for molecule optimization

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.234419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.551668Z digest=sha256:9ea1b8d3986a77499b1418af00495e2feb138bc4730b6cf8357317f75dd9aa49

Observation 4a7f36a5-e36b-4f42-b179-3ffa4f7b6085 · outbound

This paper cites A new algorithm for data compression.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A new algorithm for data compression

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.218993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.556435Z digest=sha256:26eb01dcb2fec5dd131c515d167eb08ed00b3caa703711cd36c8ec5373e30fea

Observation b376e5c0-8b05-4431-ad25-18d3f51c0417 · outbound

This paper cites Scaling laws for reward model overoptimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scaling laws for reward model overoptimization

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.203370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.561585Z digest=sha256:f089b05d21a38d369da58a0b3be7770b67c894e1d32c8170c18064d882650f02

Observation e21d29d2-23bd-4f8d-906e-1ae1ef185db7 · outbound

This paper cites Learning to navigate the synthetically accessible chemical space using reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to navigate the synthetically accessible chemical space using reinforcement learning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.187597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.566706Z digest=sha256:fd24f40b8082bff3d8a8e5fe9d14a5415d95f595445a510f293c1e6c8c054cdf

Observation d32b5402-a510-45ef-b87b-616781316bb6 · outbound

This paper cites Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.571560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.571560Z digest=sha256:985e13b36339d59118bc3b8fb8e2a530b5307219a6a47cef81a9ed4aa09b5eb9

Observation b7304e96-c6e4-4c95-91ca-e36e862cec1b · outbound

This paper cites Covid-19 vaccines and variants of concern: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 vaccines and variants of concern: A review

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.172238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.576746Z digest=sha256:77e6864dc9c7a0cfa221fb89383f4cbafebb59af0236a20bcfa37d1842aeb73d

Observation 0e52c434-b836-469b-ab68-9ec432686a76 · outbound

This paper cites Learning from Dialogue after Deployment: Feed Yourself, Chatbot!.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning from Dialogue after Deployment: Feed Yourself, Chatbot!

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.581537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.581537Z digest=sha256:d1b95b7c17b0c7c5546f07c9390bf717e55ea6217416c05e2d356bbf8afd4704

Observation 114d79ca-e711-4826-a1ba-021da26e1722 · outbound

This paper cites Molecular optimization by capturing chemist’s intuition using deep neural networks.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular optimization by capturing chemist’s intuition using deep neural networks

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.156432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.587407Z digest=sha256:13faf99e4a4a14e5dcd153b8738a03f692395e0ca300bb0bb637cc5681d11564

Observation dde8d5c8-2416-45be-b872-05cb4270c05b · outbound

This paper cites Transformer-based molecular optimization beyond matched molecular pairs.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Transformer-based molecular optimization beyond matched molecular pairs

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.141145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.592697Z digest=sha256:13d8fa71fc3a241b01fbd4dca905a1a0e6665ab269f24cb7db02ff69fcc1fed3

Observation 5c1a2ea6-fde2-4a2b-9334-ec8c4e6932d3 · outbound

This paper cites Reward learning from human preferences and demonstrations in atari.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reward learning from human preferences and demonstrations in atari

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.126101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.597480Z digest=sha256:9ba78276552f9c123c78d0b5293901622bbf9f541094ea11bd09d60e72264f11

Observation ae7472bf-2b7d-46c6-8e9a-b17704c9eefa · outbound

This paper cites The distribution of the flora in the alpine zone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The distribution of the flora in the alpine zone

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.111431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.601947Z digest=sha256:8757be46f771ab3d7acaef16d4c36ceb2c698ec569cdd7801bd7dda863e94449

Observation aa297f5a-ade7-4a7d-b120-6cebc83fd29e · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.606901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.606901Z digest=sha256:1282382f234847492ec2e99b2f60353cf6d9752114fcda43c31d25c341055da4

Observation fece7bd0-12ae-4d39-b813-073e94735335 · outbound

This paper cites A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A graph-based genetic algorithm and generative model/monte carlo tree search for the exploration of chemical space

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.096586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.612042Z digest=sha256:496cab600f8e66f9aee75f3b6ad7261ed29e212c3b21bb0a7f103f976e9c3612

Observation 9d3aabbc-ec55-47f2-a8b1-249e90dd010c · outbound

This paper cites Multi-objective molecule generation using interpretable substructures.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Multi-objective molecule generation using interpretable substructures

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.081061Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.616638Z digest=sha256:1690468252e467af026ab8ffbe966afded782c0d1baf310978b694664b4b5bb7

Observation cb0cd3ed-101b-4b17-afec-2b76042e4c5b · outbound

This paper cites Posit: flexible shape-guided docking for pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Posit: flexible shape-guided docking for pose prediction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.065686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.621388Z digest=sha256:e9a4928edaa028f864dd4c3ed60ee50f3a202a60dee0ce77b861339b5393a9b3

Observation a001709c-5cf6-4e19-b714-4d43d8d6c97e · outbound

This paper cites Giraffe: Using Deep Reinforcement Learning to Play Chess.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Giraffe: Using Deep Reinforcement Learning to Play Chess

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.626000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.626000Z digest=sha256:ca6366bfdf8efc934efaa46e00a5532ffe192e39d913750d384ad271d1467840

Observation c7eed6fe-8191-457f-afc1-e099f4c25882 · outbound

This paper cites RDkit: Open-source cheminformatics software.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RDkit: Open-source cheminformatics software

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.050462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.631332Z digest=sha256:a32ab0c88876db520159b5e8d07a5364e0baf763823f9c1f1d7db332ea80d21f

Observation 7a663836-d1df-4baa-96fd-3b8c2d7ed932 · outbound

This paper cites Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.034338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.635987Z digest=sha256:9ae543131c75d5b419d9783dd4d2a27ee8e18c476dbc393df13d7b3859313180

Observation f8dccded-8c51-48f6-b699-731479c7493b · outbound

This paper cites Scalable agent alignment via reward modeling: a research direction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Scalable agent alignment via reward modeling: a research direction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.640998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.640998Z digest=sha256:c67f37caf15b066217ade997c775ef95a0f23467189ce5dbcbf95c58cdd632e3

Observation 1a7dd7a7-bef0-403e-a139-deb71922ae6e · outbound

This paper cites Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugimprover: Utilizing reinforcement learning for multi-objective alignment in drug optimization

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.018940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.646464Z digest=sha256:76948ee3fbb75746be16d454380135447582b868fa783fca2484ccf384e58622

Observation 45814632-f5bc-4067-a44e-6ebf4a9eda45 · outbound

This paper cites Blending Imitation and Reinforcement Learning for Robust Policy Improvement.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Blending Imitation and Reinforcement Learning for Robust Policy Improvement

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.651020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.651020Z digest=sha256:1016b0c5d02c3ad1d8d79f3c3e8db626b127ccbbc7a8973c76223fdb34b63600

Observation d68f1ad5-5c2d-4a3e-9463-91497975427c · outbound

This paper cites Active policy improvement from multiple black-box oracles.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Active policy improvement from multiple black-box oracles

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:12.002550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.655982Z digest=sha256:99497d0bf63b957a9b053a28f1c1aa3f9015ddc66d7674041981c3f36f38662f

Observation cbe878d8-589b-4a63-930d-8bb6f217e96f · outbound

This paper cites Entropy-reinforced planning with large language models for de novo drug discovery.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Entropy-reinforced planning with large language models for de novo drug discovery

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.987215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.660687Z digest=sha256:7c6e2db501e3c6e7f45fda320a41bb89bcd7a95472cba841149c736fc9b0352e

Observation abe3419c-4ce9-4b80-b31d-9602a5d27bf9 · outbound

This paper cites Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drugex v3: scaffold-constrained drug design with graph transformer-based reinforcement learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.972163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.665499Z digest=sha256:c5c3a32c7b25d706b66aa9d16918ebb59bbf6c38aca02d409e65a6719fa85828

Observation f23e3ed9-0fd9-432a-96a1-000f1f2be132 · outbound

This paper cites Reinvent 4: Modern ai–driven generative molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinvent 4: Modern ai–driven generative molecule design

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.956432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.670541Z digest=sha256:a649d3311ae2ca592b03b6edbfb0cfc54a8d279470505ea08f4b35150f5fe2a3

Observation 92dd2be8-1865-48ae-946d-fe2f337ae38d · outbound

This paper cites The different mechanisms of cancer drug resistance: a brief review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization The different mechanisms of cancer drug resistance: a brief review

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.941167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.675183Z digest=sha256:3366c910e7cb86e54c93e4ca91f7cf086a203dfdb013cb7551e10740134d7810

Observation e480c6e2-d2ed-4c25-b705-2a498bc9e1ba · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Playing Atari with Deep Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.679677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.679677Z digest=sha256:7141969d1706335d1862c00dd0827dbfe3875d1747e216e8dd5cec5ddc1b8fae

Observation 338e75be-78b2-4fd9-b61d-457709dea35e · outbound

This paper cites Exploring deep recurrent models with reinforcement learning for molecule design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Exploring deep recurrent models with reinforcement learning for molecule design

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.926339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.684720Z digest=sha256:7bd26159ce84ca381b765c7d3dce33a2129dd4e7e5c674e5a7433ac8a0c81e05

Observation b4507f40-8c05-4b63-893c-b8f11b8e39df · outbound

This paper cites Molecular de-novo design through deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molecular de-novo design through deep reinforcement learning

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.911596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.689475Z digest=sha256:e5a72316e76cef3f6010cb44c559e7465170d0477e19cf4ad3b78cbc18a713d1

Observation 63ed8f5a-6c28-4931-880e-9b09de5fc5cb · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.694293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.694293Z digest=sha256:5502789d880f8e5a23489b6aa4b22fc74f1dd1ee239c677619432876b2e1c690

Observation 05bb62f3-110c-4816-afd9-60a17d77301a · outbound

This paper cites Combinatorial enumeration of groups, graphs, and chemical compounds.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Combinatorial enumeration of groups, graphs, and chemical compounds

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.897575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.699598Z digest=sha256:0be57d5bcb2a7518011f9d4616295d8b02619a3a1f32cb24e40357ffe97a1c77

Observation 324daebc-83d2-460e-9377-5d455a92e951 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Alvinn: An autonomous land vehicle in a neural network

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.883398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.704511Z digest=sha256:9bacaf412278e67c2d431a261c96f32d869ef50fe2503fa88684a3425e40769f

Observation 04c6d37d-e073-472f-8d33-a72063f62fd4 · outbound

This paper cites Deep reinforcement learning for de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for de novo drug design

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.868339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.709787Z digest=sha256:549184a37fe830fc7da7055622c0e7a2d6b0994243463df4317603a993f9eeb8

Observation 6360c346-a16e-4542-b7ff-68aeffca25f5 · outbound

This paper cites Drug repurposing: Progress, challenges and recommendations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drug repurposing: Progress, challenges and recommendations

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.853447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.714625Z digest=sha256:bd13d64363a8f80ccbee5306e83cb6e8605ee6168b1afbfd0242d9b0ed1aa0ef

Observation 82924bfc-aaeb-4363-9c18-367187623f97 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.719469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.719469Z digest=sha256:66887c3473512b60fea7a373d908b8145837bd6be71fa3e3f088ce9b046f6be8

Observation e6274477-7f12-4eb8-8b7f-b78cc1b06e12 · outbound

This paper cites Learning by playing solving sparse reward tasks from scratch.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning by playing solving sparse reward tasks from scratch

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.838474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.724522Z digest=sha256:229cc517c98085efa53e0c8d7a583c141b73dae2fdad0325ded7bb7d8436b012

Observation 9cf7afa3-b90c-453f-9ab1-185431ee459f · outbound

This paper cites Extended-connectivity fingerprints.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Extended-connectivity fingerprints

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.822920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.728977Z digest=sha256:30e55714998ee045f062d0df7fff33999a7b274d8a21bfdf435ea62ed79f2c33

Observation 923c1ada-3d19-43c8-bf55-60a20962d984 · outbound

This paper cites Reinforcement and Imitation Learning via Interactive No-Regret Learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement and Imitation Learning via Interactive No-Regret Learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.733657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.733657Z digest=sha256:eb0d0d7b962ebfcb67743eb840ea3b3d22d405798300f9b5b958396d6bec4a26

Observation 0f3302b8-5f07-40e5-a7e3-74df4faaa6cd · outbound

This paper cites A reduction of imitation learning and structured prediction to no-regret online learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reduction of imitation learning and structured prediction to no-regret online learning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.807028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.738675Z digest=sha256:ad736379abf8a2fb523ec82c6113e1c9dc5c9558561f2069edb465581fa6075d

Observation 08c26f04-fe45-446c-bb7e-c8d7bbe3b902 · outbound

This paper cites C5T5: Controllable Generation of Organic Molecules with Transformers.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization C5T5: Controllable Generation of Organic Molecules with Transformers

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:29:11.090606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.743339Z digest=sha256:9f57eb7a1e9beb2dd83b8107612300425198417f58623909a78b2a35f51b4efe

Observation e17aae1f-ad39-4e19-ad42-6afc84602047 · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Neural Machine Translation of Rare Words with Subword Units

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.748664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.748664Z digest=sha256:639b882937ccefcf6457c316fbbc785b5892bc2a5ea0f5399baaf87d7ff825ca

Observation 5178c9a0-2e29-46b7-b83a-c5196241925f · outbound

This paper cites Preference Ranking Optimization for Human Alignment.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Preference Ranking Optimization for Human Alignment

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.753720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.753720Z digest=sha256:a154adb25e2a7f52036296934926326cbc51480075e749d04d031c3b516104de

Observation 10823088-7042-4c39-b78c-4c9fde3ca91f · outbound

This paper cites Deep reinforcement learning for multiparameter optimization in de novo drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Deep reinforcement learning for multiparameter optimization in de novo drug design

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.790337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.758864Z digest=sha256:e4b16f29229f451347ebf45a3ea65eb6f0920911cb305aab6f1b248f5c055cba

Observation 37ee144e-2f30-4b2f-b5af-21356c0f20be · outbound

This paper cites ZINC15–ligand discovery for everyone.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization ZINC15–ligand discovery for everyone

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.774076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.763559Z digest=sha256:c066097df1f78e4408704ea7bf750a5b2c22191df41206a1df751f1340fe9f01

Observation 44a38208-e0ec-4566-a5d4-4d44c5fc3455 · outbound

This paper cites Learning to summarize with human feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Learning to summarize with human feedback

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.758229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.768526Z digest=sha256:6efd295075fddde9f04d5dc996cfed2644af12e8822b350a7b558b3882096bde

Observation 15067d09-f0c6-4d66-9de7-7883d3521f85 · outbound

This paper cites Molsearch: search-based multi-objective molecular generation and property optimization.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Molsearch: search-based multi-objective molecular generation and property optimization

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.742320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.773329Z digest=sha256:7120fb2d1a6f8eb1b3078acceed257ca157f2539bdacbdf988fb301d747ffb1f

Observation 469feec5-13f5-47f2-8e77-8d19c8129579 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Policy gradient meth- ods for reinforcement learning with function approximation

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.726293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.778406Z digest=sha256:489c60f77599fe2387652b1e2e4d858a80614360c2ca94a5ef255cab2063eead

Observation d3e42ab1-d33a-4709-affb-8a0690452915 · outbound

This paper cites Reinforcement learning for systems pharmacology-oriented and personalized drug design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Reinforcement learning for systems pharmacology-oriented and personalized drug design

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.711259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.783054Z digest=sha256:33bc7dc69a3379b340d708401bc6f4cc76d2c5bb79c2a8ab84b16bf0299f51e3

Observation 202f7111-55b2-412c-a7ae-549f1931acfe · outbound

This paper cites Drlinker: Deep reinforcement learning for optimization in fragment linking design.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Drlinker: Deep reinforcement learning for optimization in fragment linking design

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.694766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.788037Z digest=sha256:0cb76485d650d687a72cab4a514dbfc444886cab53ea2a2dd6d86317703f9e8d

Observation e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc · outbound

This paper cites DeepMind Control Suite.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization DeepMind Control Suite

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.793596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.793596Z digest=sha256:9001f5bc03205de9b956c8dbaf8174b0a21f09d2f80901d1a445fa19e87b2e15

Observation 40b71e8d-b632-4ee5-9a72-464d617a31a7 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.799215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.799215Z digest=sha256:9afdd6aca05a1d3447580be90667e5b315e16d4e8dff014493cf7f4652af9459

Observation fec0ce4c-f3bf-4c3c-a04a-ce7dfaaf87a0 · outbound

This paper cites Matched molecular pair analysis in short: algorithms, applications and limitations.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Matched molecular pair analysis in short: algorithms, applications and limitations

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.678824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.804399Z digest=sha256:1087058437d2623600e5c643882e7368953d5c74e0d1614a0237007edbac7c43

Observation 9a8ed734-2a4a-471a-84c4-28b01a56a7cc · outbound

This paper cites Benchmarking language-based docking models.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Benchmarking language-based docking models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.662679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.809172Z digest=sha256:5f77bc59c3dfc54cae364a6b92125a9354023017ccd95ef8245781edd0e2c251

Observation 8bf24568-87e4-47ae-9c4b-bf637c89ade6 · outbound

This paper cites Attention is all you need.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Attention is all you need

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.813976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.813976Z digest=sha256:7307e3e8b3db56db8a24c9e59d77983c32fabb4736a3e7c0ac2e25044ad0e10f

Observation 52f6e24d-3e2b-4499-baeb-dc4bc2aab748 · outbound

This paper cites Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.818690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.818690Z digest=sha256:11de412b0990b2e0fb675fd49842b00c0ee9d3ccaed8fbbbc5dc9d1c8afba6c7

Observation edcf64a5-0810-4c24-a6e8-afa7a4f859d0 · outbound

This paper cites A reinforcement learning approach for protein–ligand binding pose prediction.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization A reinforcement learning approach for protein–ligand binding pose prediction

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.635880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.823746Z digest=sha256:d15e350fe9f1820d35f9a905180390101a3c2b438089c05f1729ebdc075dfb62

Observation f994b61a-7269-49dd-8090-b8f1ec351a08 · outbound

This paper cites Smiles, a chemical language and information system.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Smiles, a chemical language and information system

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.619981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.829086Z digest=sha256:994d9a1ed348162c3819b780c3dda3ee5914da64cdd049c3ac0a83e8e7dc5821

Observation 8b7c7211-8225-4e6a-b98a-6183fba0b0d5 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.604580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.833793Z digest=sha256:ae4f268fe921d86f9dd5e5814a41ce2e38e390fca422290901812e706b979ef7

Observation 58fa5c6a-c918-4eaa-9ef0-b8dc150444d3 · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Recursively Summarizing Books with Human Feedback

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.838714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.838714Z digest=sha256:f8793c8111f98401a0296b30c1d57c7a678e74e62661caf4e3061b7ce6a134d9

Observation af742400-5b96-4b63-823e-c8c6b4b59aca · outbound

This paper cites Rlcg: When reinforce- ment learning meets coarse graining.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Rlcg: When reinforce- ment learning meets coarse graining

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.588909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.844060Z digest=sha256:1a878c31e8919ed1bd0b7494a2b7f3c1299141cec5e7efc813d7b0fa255a92fb

Observation dba36a93-4910-49b2-9b99-285bbd402e00 · outbound

This paper cites Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.848704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.848704Z digest=sha256:c63cef503f36e81afbd7feed7036f98b9ed62e22f83b112f094614885dc26c5f

Observation a1231f94-5d75-4426-8925-59a0c3e6d2bc · outbound

This paper cites Population-based de novo molecule generation, using grammatical evolution.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Population-based de novo molecule generation, using grammatical evolution

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.572547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.854230Z digest=sha256:17ca712c15e9b59b5f8a147ed9544ed0963b311075cc0c08a6a9113178ecce1b

Observation 45f5e9b4-6aea-412f-9781-7ea6f37df6f9 · outbound

This paper cites Graph convolutional policy network for goal-directed molecular graph generation.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Graph convolutional policy network for goal-directed molecular graph generation

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.555221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.858943Z digest=sha256:35d6dedca76bfe94afff5ac14c4131374373349a969ecf5ba42e6ed4a4876d47

Observation 3ebf7b5d-0ca2-4611-99a3-a929bb3607b9 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.539385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.863986Z digest=sha256:62769ba0c5501c393619fcd8ac67a4d6f2a7c5a3cd861968517647a0726b030c

Observation 0959e6bb-b69f-4519-b139-d1afefd35b8d · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.869139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.869139Z digest=sha256:742636038237e6f5fcd2cc96b35b1e9f749097e5ef3096836d795a67b083ab1c

Observation 910f057e-941d-4419-be53-bfbc0764eb8d · outbound

This paper cites Covid-19 pathophysiology: A review.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Covid-19 pathophysiology: A review

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.523296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.874390Z digest=sha256:873b81f7ce6706d1e23d2df979abd1757d2987213b47101f368c854fda24f00c

Observation 3e9b7808-5ea1-409d-92de-313d0a645cb9 · outbound

This paper cites Universal approach to de novo drug design for target proteins using deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Universal approach to de novo drug design for target proteins using deep reinforcement learning

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.508183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.879206Z digest=sha256:2725cc92203cb23fcec52b51d91abf7957879e2cfc6a4e1953944a8b147af437

Observation eef72f93-4f95-40c2-8916-4eb13c4799fc · outbound

This paper cites Optimization of molecules via deep reinforcement learning.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Optimization of molecules via deep reinforcement learning

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:29:11.491284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T13:29:10.884009Z digest=sha256:d86d2315c8909ad018d03245b5124f145726669beabd4703d386d79e9ce43e30

Observation b5fe6846-2656-4838-8bc3-70065bc8adff · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization Fine-Tuning Language Models from Human Preferences

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-08T13:29:10.888735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:29:10.888735Z digest=sha256:85948e8cd45f33b87c785f4f82ec8f84ca0033d2d0ee24ec9719207c546f12c0

Pith citing papers

No inbound Pith citation observations are available.