{"as_of":"2026-08-09T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e4cb41f96422e22f75b7b2020fc545b505a068808234e02fcf6008b253cc4ce","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:39:16.008611Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19044/citation-record","integrity":"/paper/2607.19044/integrity","json":"/paper/2607.19044/citation-record.json","paper":"/paper/2607.19044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:06.770605Z","title":"Crystal diffusion variational autoencoder for periodic material generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:06.770605Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1d4e44aca181974b4ac20c3bb45fbabaa8ed539c222ea200da2ee75ef0912544","observation_id":"f7540bac-d383-4e73-8244-d11db3c25e66","resolution":{"observed_at":"2026-08-01T13:39:06.770605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02923","last_updated":"2022-03-06T09:47:01Z","snapshot_observed_at":"2026-07-06T12:44:48.852327Z","submitted_at":"2022-03-06T09:47:01Z","title":"GeoDiff: a Geometric Diffusion Model for Molecular Conformation Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02923","snapshot_observed_at":"2026-08-01T13:39:06.869526Z","title":"Geodiff: A geometric diffusion model for molecular conformation generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:06.869526Z"},"links":{"cited_paper":"/paper/2203.02923","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:9bd35615b9ef16e0644b95ad641e558f4c63ed26cc47e9b48a25ba102ec43f6a","observation_id":"78e11b98-7170-4db8-8153-bcf9dd413d2b","resolution":{"observed_at":"2026-08-01T13:39:06.869526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:06.973777Z","title":"Accelerating 3d molecule generation via jointly geometric optimal transport,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:06.973777Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:4e604be09681522b0594ea965b125b1ac770d29250e03cbc9bea93caea23e157","observation_id":"ee50e27e-e4ee-40ed-b2af-0ec0d23bcea9","resolution":{"observed_at":"2026-08-01T13:39:06.973777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.089640Z","title":"Diffusion-driven domain adaptation for generating 3d molecules,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.089640Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:7cdde65e8771ec3079679bfc1397cae17eddc27cf3855809197418727e61cf0f","observation_id":"a55952d7-9605-44b9-899c-c2a6c60af77d","resolution":{"observed_at":"2026-08-01T13:39:07.089640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.229619Z","title":"Crystalline material discovery in the era of artificial intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.229619Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:38f9b5aa72227aeb8fa4366e89113bc9ce4bfe5e6fccd78b6a3419423225c3df","observation_id":"1a277d19-95bf-4883-9393-aec4972e3a94","resolution":{"observed_at":"2026-08-01T13:39:07.229619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.393415Z","title":"Estimation of the size of drug-like chemical space based on gdb-17 data,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.393415Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:06df24e8cfb266d39069fb6e32917a4334a7ebad64c1a924158c25ec9faba5f3","observation_id":"491b4599-8707-4942-853a-7c6b8ed62a0a","resolution":{"observed_at":"2026-08-01T13:39:07.393415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.559256Z","title":"Impact of high-throughput screening in biomedical research,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.559256Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:5395b6956ba75b17cf2e22b6c05c3f01c98dad5737a360da2612676cb4da48a5","observation_id":"d194acb9-f77e-44b2-a6e5-9f0f97c1c95e","resolution":{"observed_at":"2026-08-01T13:39:07.559256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.683296Z","title":"Strategy to discover diverse optimal molecules in the small molecule universe,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.683296Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:a0b60a9003c5a905064c12f8f3a2692b045df5ab21f082ab182d67682fe7e2cd","observation_id":"70c503db-c76e-4271-98c3-c821b78516b4","resolution":{"observed_at":"2026-08-01T13:39:07.683296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.799487Z","title":"Medgan: optimized generative adversarial network with graph convolutional networks for novel molecule design,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.799487Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:a34a405d3a436f9b84daa601b189c5b61adc29527b7706f3d7c140c97270a5eb","observation_id":"179cfc09-ab77-43da-8127-72bd4ed7db20","resolution":{"observed_at":"2026-08-01T13:39:07.799487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:07.915642Z","title":"Equivariant flow matching with hybrid probability transport for 3d molecule generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:07.915642Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1d20e8651c274a691426fe60700ac92b16b97e57261d8832d306940af7fc9001","observation_id":"3ba0e20d-5dd4-4001-bef7-eba54aa0dde7","resolution":{"observed_at":"2026-08-01T13:39:07.915642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.032070Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.032070Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:579b60ac183025d01d9c536510e54052a1b5d1b944832bfdfb21ec0e332cf572","observation_id":"724db459-2906-4db3-9e93-c0b6a55b16f9","resolution":{"observed_at":"2026-08-01T13:39:08.032070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.140819Z","title":"Automatic chemical design using a data-driven continuous representation of molecules,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.140819Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:af6a345b984658063a8297d7b718058410448bdc6439189b0b74d0936217079f","observation_id":"97862e60-44e2-4b74-beaa-09c79bb8acab","resolution":{"observed_at":"2026-08-01T13:39:08.140819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.257056Z","title":"Junction tree variational autoen- coder for molecular graph generation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.257056Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:ed9c29fb62850618c69ed49fcc0030b7ce0fc70773a8f7b8f6b59ea9fb27c5f0","observation_id":"a263c8a1-1f89-4d36-877f-a6e875e1e1da","resolution":{"observed_at":"2026-08-01T13:39:08.257056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.372056Z","title":"Limo: 10 Latent inceptionism for targeted molecule generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.372056Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:95e2e4eda02fe07e951fa242e4e78c0a96ce31f7a18edad2bee3a0148968f2b1","observation_id":"acb6f667-9305-4239-a951-0cfdf8ad8727","resolution":{"observed_at":"2026-08-01T13:39:08.372056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10843","last_updated":"2018-02-07T04:58:57Z","snapshot_observed_at":"2026-07-31T23:26:47.539311Z","submitted_at":"2017-05-30T19:58:08Z","title":"Objective-Reinforced Generative Adversarial Networks (ORGAN) for Sequence Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10843","snapshot_observed_at":"2026-08-01T13:39:08.539015Z","title":"Objective-reinforced generative adversarial networks (organ) for sequence generation models,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.539015Z"},"links":{"cited_paper":"/paper/1705.10843","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1d321e0422e47e897849f8b2e6d03f1249cf676c8417cd875dc66541d8c70fc0","observation_id":"f5f4fcc1-d558-4792-a116-f3f132cdc1af","resolution":{"observed_at":"2026-08-01T13:39:08.539015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.635378Z","title":"drugan: an advanced generative adversarial autoencoder model for de novo generation of new molecules with desired molecular properties in silico,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.635378Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:edf278244db351cf49e6b3811198e4a6b08abe97092ba456ef82a5e06acdfbd6","observation_id":"ec7b1bb4-f78c-443e-82ce-0bcb02307069","resolution":{"observed_at":"2026-08-01T13:39:08.635378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.637743Z","title":"Graph convolutional policy network for goal-directed molecular graph generation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.637743Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:2736dc4d1c55790103840fcbc22e823f3c64b6bf81713b6d855fd6ab1a68c1bf","observation_id":"93c8a075-b445-40fe-b42d-5db8a61a97ab","resolution":{"observed_at":"2026-08-01T13:39:08.637743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.695871Z","title":"Graphdf: A discrete flow model for molecular graph generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.695871Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:7616394e5fb1066ac3bb415057feee75c2991b72b7b0ab165db52376d7a10325","observation_id":"eb4df5e1-b453-4ce4-9197-d24ee8cf9ad4","resolution":{"observed_at":"2026-08-01T13:39:08.695871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09382","last_updated":"2020-02-27T05:34:03Z","snapshot_observed_at":"2026-08-07T03:50:10.854073Z","submitted_at":"2020-01-26T01:12:40Z","title":"GraphAF: a Flow-based Autoregressive Model for Molecular Graph Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09382","snapshot_observed_at":"2026-08-01T13:39:08.782483Z","title":"Graphaf: a flow-based autoregressive model for molecular graph generation,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.782483Z"},"links":{"cited_paper":"/paper/2001.09382","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:38dfb1972dd92588900a80ff1cf475e2b99985e8b4e35b67b8fba0ecc21bc8bc","observation_id":"d7354777-f3ee-436f-8fa2-68d296d487f3","resolution":{"observed_at":"2026-08-01T13:39:08.782483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:08.910564Z","title":"Constrained graph variational autoencoders for molecule design,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:08.910564Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:f6ea5a191ad0afd9c806dcca0a25a49f4d0dfb42584e11bb48ec24aff6ba22b4","observation_id":"d2d4828d-8ef3-4db2-8481-fff802d9da52","resolution":{"observed_at":"2026-08-01T13:39:08.910564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11126","last_updated":"2023-04-24T17:50:51Z","snapshot_observed_at":"2026-08-05T21:48:15.219923Z","submitted_at":"2022-08-23T17:01:16Z","title":"Retrieval-based Controllable Molecule Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11126","snapshot_observed_at":"2026-08-01T13:39:09.055606Z","title":"Retrieval-based controllable molecule generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.055606Z"},"links":{"cited_paper":"/paper/2208.11126","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:9c2757b287e236c434674b8ec3bfff2df82d971400ac4c77bf3ee8ecba12f78b","observation_id":"00369f46-1e24-4475-9abb-73531aaa5fdc","resolution":{"observed_at":"2026-08-01T13:39:09.055606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-01T13:39:09.191105Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.191105Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:271b505341540687b3ba113a993603f33d87cbb0b8a3f8084d9da91945e1d4db","observation_id":"ff09af64-6b10-41b1-934d-b5a048bab4f1","resolution":{"observed_at":"2026-08-01T13:39:09.191105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:09.331391Z","title":"Language models can learn complex molecular distributions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.331391Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:cf809a2dc574520703137492faa792f171f21a9361ad6bd43e0c1705a7422e92","observation_id":"3d915b23-19e6-4f4b-8edf-274a38cdbbf4","resolution":{"observed_at":"2026-08-01T13:39:09.331391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:09.459415Z","title":"Smiles, a chemical language and information system. 1. introduction to methodology and encoding rules,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.459415Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:b17bb82dacf6da8c2ad3efce534da7f0f19571e071e65615de3999134a3f31ba","observation_id":"df764fee-82bf-4854-aaf0-60ae9885f28f","resolution":{"observed_at":"2026-08-01T13:39:09.459415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:09.603226Z","title":"A systematic study of key elements underlying molecular property prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.603226Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:d3f05c50c7262f66fe5c03235e03d8e1d95fa220f6db7e77db343de7b8665418","observation_id":"c081fe2c-200d-4624-b979-a6fb6abb0a8b","resolution":{"observed_at":"2026-08-01T13:39:09.603226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:09.743978Z","title":"A review of molecular representation in the age of machine learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.743978Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:446d8e280bb05744b984b193548ac33c6b5e36740ba4dd60c8628b6c94cd852f","observation_id":"bf8b95af-ca54-4d62-be77-ddf28cedcbbe","resolution":{"observed_at":"2026-08-01T13:39:09.743978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:09.897589Z","title":"Chemformer: a pre- trained transformer for computational chemistry,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:09.897589Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:20465d3d5bd009d122421165615a9411685e3db76aac6c74328f0f5f56bbb0db","observation_id":"065cc472-eb16-4ea5-b550-c69dea53b2fb","resolution":{"observed_at":"2026-08-01T13:39:09.897589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:10.102003Z","title":"Empowering molecule discovery for molecule-caption translation with large language models: A chatgpt perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:10.102003Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:9a2511d941422ac391982b6051eb98e1553d80b3f46e65768bd77d366c7df3aa","observation_id":"634ef702-d8bc-4561-9d02-a0348fa689bd","resolution":{"observed_at":"2026-08-01T13:39:10.102003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:10.309025Z","title":"Conversational drug editing using retrieval and domain feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:10.309025Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:eacbcb41c2576569d09199d391634f8acecdc51c4641411a87e95c72197fac61","observation_id":"1b46b590-9b9d-48ee-ad10-51a881f58262","resolution":{"observed_at":"2026-08-01T13:39:10.309025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:10.526533Z","title":"Domain- agnostic molecular generation with chemical feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:10.526533Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:86b99faa1a095db675f0284b22902ca22d46b2b5833bb597cea6909113b56b82","observation_id":"9a0d2b95-9ca5-40c6-946e-4f691af3b45f","resolution":{"observed_at":"2026-08-01T13:39:10.526533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13372","last_updated":"2019-05-31T01:33:13Z","snapshot_observed_at":"2026-08-07T09:01:09.883892Z","submitted_at":"2019-05-31T01:33:13Z","title":"MolecularRNN: Generating realistic molecular graphs with optimized properties","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13372","snapshot_observed_at":"2026-08-01T13:39:10.685304Z","title":"Molecularrnn: Generat- ing realistic molecular graphs with optimized properties,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:10.685304Z"},"links":{"cited_paper":"/paper/1905.13372","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:05d69c0e4d592cff6b9ad1eda5eefdf7e6b54db4d308ee841de477ab01fdb08c","observation_id":"9c00d5ed-1a0f-4d4a-b0ec-6a7b36183712","resolution":{"observed_at":"2026-08-01T13:39:10.685304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10432","last_updated":"2021-03-18T10:04:15Z","snapshot_observed_at":"2026-08-01T09:00:06.708904Z","submitted_at":"2021-03-18T10:04:15Z","title":"MARS: Markov Molecular Sampling for Multi-objective Drug Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10432","snapshot_observed_at":"2026-08-01T13:39:10.831523Z","title":"Mars: Markov molecular sampling for multi-objective drug discovery,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:10.831523Z"},"links":{"cited_paper":"/paper/2103.10432","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:763772628f47adbf1bab5d2932d54285f8b53b9d66a270cc34e9f7554014d5fe","observation_id":"9bbdd0a6-37fc-474c-bee3-3fdc86bba183","resolution":{"observed_at":"2026-08-01T13:39:10.831523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-01T13:39:11.012597Z","title":"T\\” ulu 3: Pushing frontiers in open language model post-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.012597Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:772976d43402dbbb23a86298292adacff30350f588a352d64dd0000759383a3a","observation_id":"1165f557-45c8-4e02-8012-41b4b3a0a7b9","resolution":{"observed_at":"2026-08-01T13:39:11.012597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:11.215535Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.215535Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:50b4a63be108b01061da79cee8dff033feb7fafc085991343fcb0d5a18d6dd4d","observation_id":"899c8e91-0af9-4f04-8383-8dfa1dcfb395","resolution":{"observed_at":"2026-08-01T13:39:11.215535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T13:39:11.347015Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.347015Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:f712b6ac62527c8758f90d55858c68e47cbcb3309ce196b9f0fa4a90750fc7b7","observation_id":"043dc77e-a570-49ae-93f4-d6f418f0d664","resolution":{"observed_at":"2026-08-01T13:39:11.347015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:11.525531Z","title":"Rdkit: A software suite for cheminformatics, computational chemistry, and predictive modeling,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.525531Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:13af0295ad06a10201d0f6bb40b72962b2165cfa7fa2437b524f55a957d69117","observation_id":"cf565f18-c4a4-40d1-b401-eca5eb7c8205","resolution":{"observed_at":"2026-08-01T13:39:11.525531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T13:39:11.663054Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.663054Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:59666993ba25487b153e45eb242d43ed181530ea9753b6612fd54e3c3e08ef3b","observation_id":"88e10974-d2da-4b96-8785-cf8884f11247","resolution":{"observed_at":"2026-08-01T13:39:11.663054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01070","last_updated":"2019-01-28T19:38:39Z","snapshot_observed_at":"2026-08-02T03:53:01.489931Z","submitted_at":"2018-12-03T20:28:09Z","title":"Learning Multimodal Graph-to-Graph Translation for Molecular Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01070","snapshot_observed_at":"2026-08-01T13:39:11.878284Z","title":"Learning multimodal graph-to-graph translation for molecular optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:11.878284Z"},"links":{"cited_paper":"/paper/1812.01070","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1a03c9bdccdc04895aaf5f872847ce7b8b28b1e1d2ab5e3ec9badddc0f1f5046","observation_id":"381eaec8-9fe1-438e-9f62-a0b8e7a20a59","resolution":{"observed_at":"2026-08-01T13:39:11.878284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:12.085049Z","title":"Deep learn- ing for molecular design—a review of the state of the art,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:12.085049Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:fda141a2777908d5351ae2212d274bebb6bd0eea1373bbac27416fc24f9ad088","observation_id":"354a0825-163e-49f9-9421-300f0a6301d8","resolution":{"observed_at":"2026-08-01T13:39:12.085049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:12.326045Z","title":"Autoencoders, unsupervised learning, and deep architectures,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:12.326045Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1ea30c218c6eb832c2d82ccfe224d8e6c22e1a46683919ec6fa00fbb4c8389a9","observation_id":"203d8ef9-bf72-4abf-b706-304d248e7060","resolution":{"observed_at":"2026-08-01T13:39:12.326045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:12.497173Z","title":"Efficient multi-objective molecular optimization in a continuous latent space,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:12.497173Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:438213c05d141cfbea73f21eb2061a433f1d686988025a7af5cbe9560dc5dbdc","observation_id":"d897fefd-0765-45ba-afcd-ed4bc3de2933","resolution":{"observed_at":"2026-08-01T13:39:12.497173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:12.694368Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:12.694368Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:27a5c53a12727822f10bcd7d89a4173f25e67d100a459f97dd5e798cfeb7b674","observation_id":"f23c8b40-0a45-4958-9f78-b8c521ca25ba","resolution":{"observed_at":"2026-08-01T13:39:12.694368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:12.873419Z","title":"Reinforced ad- versarial neural computer for de novo molecular design,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:12.873419Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:75fec98513434008ec0e86016d6152859452009750167ae20b7fa5157df2d41c","observation_id":"b2d722fd-18c4-4d74-96eb-a9927e1414f1","resolution":{"observed_at":"2026-08-01T13:39:12.873419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:13.155537Z","title":"De novo generation of hit-like molecules from gene expression signa- tures using artificial intelligence,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.155537Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:693168ee80cea22663b8f4c300276034239358e02d4f99344e2c7f308fbd24c6","observation_id":"7518aa54-424d-4bd7-8aa6-de01541b8607","resolution":{"observed_at":"2026-08-01T13:39:13.155537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:13.317564Z","title":"Hierarchical generation of molecular graphs using structural motifs,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.317564Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:94f14802c731e7080ee2de179375594cc8044368ed5f87a2d63b7650ae6d5d2b","observation_id":"793705d0-c806-4d87-91eb-9e7f48b9d738","resolution":{"observed_at":"2026-08-01T13:39:13.317564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09267","last_updated":"2023-10-13T17:25:11Z","snapshot_observed_at":"2026-08-09T08:16:38.647148Z","submitted_at":"2023-10-13T17:25:11Z","title":"Genetic algorithms are strong baselines for molecule generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09267","snapshot_observed_at":"2026-08-01T13:39:13.434988Z","title":"Genetic algorithms are strong baselines for molecule generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.434988Z"},"links":{"cited_paper":"/paper/2310.09267","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:7d72b7f939d5ec68e344ae985ea167a4fd0b34fe31bef54ea6c20ebbb13353cd","observation_id":"a72a7859-f500-41ca-b9ed-cd991c891b0d","resolution":{"observed_at":"2026-08-01T13:39:13.434988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11655","last_updated":"2020-01-15T23:23:23Z","snapshot_observed_at":"2026-07-06T08:24:35.659730Z","submitted_at":"2019-09-25T17:59:17Z","title":"Augmenting Genetic Algorithms with Deep Neural Networks for Exploring the Chemical Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11655","snapshot_observed_at":"2026-08-01T13:39:13.498164Z","title":"Augmenting genetic algorithms with deep neural networks for exploring the chemical space,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.498164Z"},"links":{"cited_paper":"/paper/1909.11655","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:9173a732d2604641818a01907637bff12a817bd4c19f1582a7356d0e2b5aab05","observation_id":"53d94f9d-1ea1-45ed-b5d2-38c6e52970b7","resolution":{"observed_at":"2026-08-01T13:39:13.498164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:13.597467Z","title":"Regression transformer enables concurrent sequence regression and generation for molecular language modelling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.597467Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:e6653ab53463b0dfdacc840d957d82443bc6c3476195c633f4a786a6553dad45","observation_id":"e4ca895b-b87e-4ecb-9238-7a9593ea6720","resolution":{"observed_at":"2026-08-01T13:39:13.597467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11817","last_updated":"2022-11-03T23:24:33Z","snapshot_observed_at":"2026-07-06T13:03:36.428167Z","submitted_at":"2022-04-25T17:48:09Z","title":"Translation between Molecules and Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11817","snapshot_observed_at":"2026-08-01T13:39:13.713228Z","title":"Translation between molecules and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.713228Z"},"links":{"cited_paper":"/paper/2204.11817","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:98f8a5f86957f76163932c9fb5d581608bcda669d18ae01b400572aa169c1a49","observation_id":"f6405a04-c01f-41dc-9027-6dcc5f837e22","resolution":{"observed_at":"2026-08-01T13:39:13.713228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:13.812839Z","title":"Hierarchical deep re- inforcement learning for multi-robot cooperation in partially observable environment,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.812839Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:990929d164954c0f03459a0ed2013a3a07a6e5a0d0ffe54c3fec33a349b4be44","observation_id":"9dff0155-c829-4c62-acaa-83815e7d55fd","resolution":{"observed_at":"2026-08-01T13:39:13.812839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:13.935026Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collab- oration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:13.935026Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:4d84c565f1a8cb4f0f309d4f1f625bbfc5a7849f057e084827c720fb219f7a9e","observation_id":"9da5a243-d1c6-4531-873d-249d7cdac5ef","resolution":{"observed_at":"2026-08-01T13:39:13.935026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.018214Z","title":"Scaling laws for reward model overoptimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.018214Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:f1c59199b5b8d5e412b617e9e95831eb93bfdf340a5733dd50faf9e84f4e6ee2","observation_id":"92ea5069-01fc-41f9-a1a5-bddfa748f8fd","resolution":{"observed_at":"2026-08-01T13:39:14.018214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T13:39:14.102320Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.102320Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:79a9c01817978c5f007db9ecf3a9bd8b7296dfb1d9132a55bdb3c767a7b45cea","observation_id":"d8de289f-865e-4663-81f2-0dff55b28b5e","resolution":{"observed_at":"2026-08-01T13:39:14.102320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.186968Z","title":"Deep reinforcement learning for de novo drug design,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.186968Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:07151f3c4fd703638cb6908ce0397955b78fde5a966602fd39ed0c43fd0d1fc8","observation_id":"ecf57934-4b91-40db-9e0c-1731705bf073","resolution":{"observed_at":"2026-08-01T13:39:14.186968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T13:39:14.269673Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.269673Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:730f3b158bba8be232694d05285220776fd1d8ae0517fe0e88578f7371b76042","observation_id":"f948f92f-fe37-4e53-b45c-ee7aaa7b73a6","resolution":{"observed_at":"2026-08-01T13:39:14.269673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.372187Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynamics, and success amplification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.372187Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:14dace94b4d486df1d0d464b2e3632a6a680aad7722f302fdc333294ff49055f","observation_id":"481ca191-e102-4c87-be98-aa7ea9e65e4c","resolution":{"observed_at":"2026-08-01T13:39:14.372187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.478876Z","title":"Self- referencing embedded strings (selfies): A 100% robust molecular string representation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.478876Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:cdf1d881157a1631826e5c572b6cb9975b6b9e6a5172e2805bbbd4ec58a9568e","observation_id":"ca19deee-354d-4a25-80cc-83ab4f58df8d","resolution":{"observed_at":"2026-08-01T13:39:14.478876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.614040Z","title":"Zinc 15–ligand discovery for everyone,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.614040Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:fe50e2e3550279219b11ea50c9fc85414bb42e90ab9704132e87067a61dc77cf","observation_id":"f82e891f-9ac7-4cce-b3e8-77749337e1d0","resolution":{"observed_at":"2026-08-01T13:39:14.614040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.726505Z","title":"Quantifying the chemical beauty of drugs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.726505Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:deb5e57f4e3349b2adb8d6c69974f253e809688812cd09df2f5d8bcadef40012","observation_id":"677b7bac-9175-4725-9cea-3b9b0b257198","resolution":{"observed_at":"2026-08-01T13:39:14.726505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:14.884404Z","title":"Optimization of molecules via deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:14.884404Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:8bfed8a4f5f7fd495234fb399dd4a07b9175812fcdff83100e08f7b1472b8787","observation_id":"f22b35a8-59c2-470c-82a5-8eb9814a8e76","resolution":{"observed_at":"2026-08-01T13:39:14.884404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:15.050390Z","title":"Extended-connectivity fingerprints,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.050390Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:db68a4461e6c22517f9c178fd8a9adaf5813c1f10f5488e0ade02292389bfbbd","observation_id":"f5132e12-e561-4256-951f-31c9dafd0645","resolution":{"observed_at":"2026-08-01T13:39:15.050390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-01T13:39:15.218053Z","title":"Quiet-star: Language models can teach themselves to think before speaking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.218053Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:9cec0ed3f474bd6bc5acb0866cddb308745f9a18d929aa739c01bea7c62494e5","observation_id":"51864bbf-ee06-4750-8ff3-fc3ac74b4f9b","resolution":{"observed_at":"2026-08-01T13:39:15.218053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:15.342072Z","title":"Training chain- of-thought via latent-variable inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.342072Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:1fe415e382c768aa77511699dcde4460c0609b0f09fe8f769850072546e91a11","observation_id":"70dd1fe4-a02b-4b26-a492-9ec369a7b6b3","resolution":{"observed_at":"2026-08-01T13:39:15.342072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T13:39:15.458226Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.458226Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:d048ecd2f2534d5e2dee0ed8ae5623b764ae2c1b0d15308c3076c3e96b21e439","observation_id":"ae5926b7-33cb-4f8d-93b0-fb5d51422def","resolution":{"observed_at":"2026-08-01T13:39:15.458226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:15.574482Z","title":"Moleculenet: a benchmark for molecular machine learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.574482Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:2e47bdd4112acc2758418e8f98302c777f60968d413563e7c57bd9dbe384c033","observation_id":"2129baba-e7a5-445f-b1e2-aa2714dc6e00","resolution":{"observed_at":"2026-08-01T13:39:15.574482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T13:39:15.652765Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.652765Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:6caf65c88c6e8b366d6808c3c7610ef746a689e4f2dee762c7dd7bbf244deaf8","observation_id":"8c6a9ff5-b478-43a1-bd1c-422e12c68a34","resolution":{"observed_at":"2026-08-01T13:39:15.652765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:15.750866Z","title":"Transformers: State- of-the-art natural language processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.750866Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:0661b39f9956a207eebde9e129f02b9c70a018cc4ec90044aab515ee0aaf71b5","observation_id":"fc250746-a332-4b35-9bdf-ebbdc75566a7","resolution":{"observed_at":"2026-08-01T13:39:15.750866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:15.862595Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.862595Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:8c09989c4c9482e199d222b14b5b73c3cab5aa30456052089b5f345126e6efaa","observation_id":"11116f65-dbcc-4a81-8352-71f3a0a7d98f","resolution":{"observed_at":"2026-08-01T13:39:15.862595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:39:16.008611Z","title":"Virtual compound libraries in computer-assisted drug discovery,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:16.008611Z"},"links":{"citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:e06f294d41e240cbe0b35955aa357e740b484af8f4dde594ae02c5d43c34aeae","observation_id":"3e3ed461-39ba-4d15-adb8-da95984cca7b","resolution":{"observed_at":"2026-08-01T13:39:16.008611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:43:16.936553Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2607.19044."}