{"as_of":"2026-08-21T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1163e7af58f944bb19a1d6bae93a1e876f1c8a3d7168d24adeb7c9f06ae5c543","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:01:49.253498Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:31:09.879734Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:08:43.653689Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.14460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14460","snapshot_observed_at":"2026-07-03T17:08:43.653689Z","title":"arXiv preprint arXiv:2506.14460 , year=","venue":null,"work_id":"66393c41-34b2-4ed9-9274-2e74223f37db","year":2025},"citing_paper":{"arxiv_id":"2604.08508","last_updated":"2026-04-12T20:12:01Z","snapshot_observed_at":"2026-08-15T05:42:42.821939Z","submitted_at":"2026-04-09T17:49:40Z","title":"Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:38:49.399967Z"},"links":{"cited_paper":"/paper/2506.14460","citing_paper":"/paper/2604.08508"},"observation_digest":"sha256:2114134d1b9a70e0d62625cde60ce78df7a83bb2384e340a73b549d1911da0bd","observation_id":"b8929d60-21e8-410a-ae31-8af0b5fe07b0","resolution":{"observed_at":"2026-05-11T06:25:58.896606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.14460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14460","snapshot_observed_at":"2026-07-03T17:08:43.653689Z","title":"arXiv preprint arXiv:2506.14460 , year=","venue":null,"work_id":"66393c41-34b2-4ed9-9274-2e74223f37db","year":2025},"citing_paper":{"arxiv_id":"2605.15622","last_updated":"2026-05-18T07:21:10Z","snapshot_observed_at":"2026-08-16T09:40:27.032332Z","submitted_at":"2026-05-15T05:11:43Z","title":"Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T21:19:55.074853Z"},"links":{"cited_paper":"/paper/2506.14460","citing_paper":"/paper/2605.15622"},"observation_digest":"sha256:e2f8d1db45cdd110a275a97040357d4b40204c4be7e1be42f055f19778efea8d","observation_id":"c82187c8-6ae4-403b-a20b-5814e2bd2ff7","resolution":{"observed_at":"2026-05-20T21:23:44.549328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.14460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14460","snapshot_observed_at":"2026-07-03T17:08:43.653689Z","title":"arXiv preprint arXiv:2506.14460 , year=","venue":null,"work_id":"66393c41-34b2-4ed9-9274-2e74223f37db","year":2025},"citing_paper":{"arxiv_id":"2605.30960","last_updated":"2026-05-29T07:55:57Z","snapshot_observed_at":"2026-08-18T08:35:08.524875Z","submitted_at":"2026-05-29T07:55:57Z","title":"Revisiting Zeroth-Order Hessian Approximation: A Single-Step Policy Optimization Lens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:09.879734Z"},"links":{"cited_paper":"/paper/2506.14460","citing_paper":"/paper/2605.30960"},"observation_digest":"sha256:f293254e1d90ca5aaaf576ba3798b28669a1962036ee130810e8c022c77e326c","observation_id":"f43334c6-d3dd-4385-92e5-79729074c6cc","resolution":{"observed_at":"2026-06-28T23:32:46.943345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.14460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14460","snapshot_observed_at":"2026-07-03T17:08:43.653689Z","title":"arXiv preprint arXiv:2506.14460 , year=","venue":null,"work_id":"66393c41-34b2-4ed9-9274-2e74223f37db","year":2025},"citing_paper":{"arxiv_id":"2606.14970","last_updated":"2026-06-22T08:40:27Z","snapshot_observed_at":"2026-08-15T05:15:12.732458Z","submitted_at":"2026-06-12T21:46:54Z","title":"Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T04:33:10.554853Z"},"links":{"cited_paper":"/paper/2506.14460","citing_paper":"/paper/2606.14970"},"observation_digest":"sha256:9f0954c4029138023f96ed576383c9690290d3f2aacb9327cc1e0959be8ec3ec","observation_id":"f531c490-514a-4ff1-a5c0-1023ef06467d","resolution":{"observed_at":"2026-07-03T17:08:43.655176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14460/citation-record","integrity":"/paper/2506.14460/integrity","json":"/paper/2506.14460/citation-record.json","paper":"/paper/2506.14460"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.103621Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.103621Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:3e656d874a5b248d1aa6857ec2e0150502e4cb4fe2c87b53b4d1ba759fe5b98d","observation_id":"57d727e2-4e18-4129-9a3b-a41cf7f67db6","resolution":{"observed_at":"2026-08-15T20:01:49.103621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.110677Z","title":"Zo-adamm: Zeroth-order adaptive momentum method for black-box optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.110677Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:20a5efadb61b0703700f0361da84fdbde1ad95ad3c3bde933242fd630ba6b828","observation_id":"78c96441-21d5-4c95-8d03-907a6868648b","resolution":{"observed_at":"2026-08-15T20:01:49.110677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.115459Z","title":"On the convergence of prior-guided zeroth-order optimization algorithms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.115459Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:385f2218cc98e8d1054f65ada20ebed6b600274be3d731924eba4e212ac4424e","observation_id":"9bdeea19-90e6-4467-8b29-39f4524675bd","resolution":{"observed_at":"2026-08-15T20:01:49.115459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.657226Z","title":"T., and McMahan, H","venue":null,"work_id":"a336eb90-fbc6-4124-bb66-d23bc8cadcd8","year":2005},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.120356Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:fd01bbeea9dde714eb3d63b3910e865a5849efc24eb34d22b283ff01dc40477b","observation_id":"f3c73ee0-a4e7-4335-bc5c-a7c71fbd0049","resolution":{"observed_at":"2026-08-15T20:01:49.661735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.643117Z","title":"D., Kalai, A","venue":null,"work_id":"0077a4f6-a86d-4414-80d4-abf1cf74c3e0","year":2005},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.125532Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:224a1367d6cdeb500e9b4e8804078653a2c529e3e9d84cfd96116ea079d89713","observation_id":"91e4752f-9096-49fd-8916-592c0ae41fb5","resolution":{"observed_at":"2026-08-15T20:01:49.647506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.130309Z","title":"and Lan, G","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.130309Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:8c261dd7f11d9f0bf21e79a5592602bac6b48c4340cd5109157830dfd75cd30f","observation_id":"c428b578-5273-4838-95bc-b8433d5e4e25","resolution":{"observed_at":"2026-08-15T20:01:49.130309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.134920Z","title":"Mini-batch stochastic approximation methods for nonconvex stochastic composite optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.134920Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:578b39b72612e9558dc4007c3390013373d9a3cab5d9422081b879c065c3d7d2","observation_id":"23051c32-e271-426a-a365-3c669df1f530","resolution":{"observed_at":"2026-08-15T20:01:49.134920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09026","last_updated":"2021-02-17T21:03:05Z","snapshot_observed_at":"2026-08-18T08:32:24.055104Z","submitted_at":"2021-02-17T21:03:05Z","title":"Optimizing Large-Scale Hyperparameters via Automated Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09026","snapshot_observed_at":"2026-08-15T20:01:49.139676Z","title":"Optimizing large-scale hyperparameters via automated learning algorithm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.139676Z"},"links":{"cited_paper":"/paper/2102.09026","citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:4403654e34df6f98f54758bb3889a9573a37ce4d960283ece9b97c54ab2759bb","observation_id":"adf94ff1-c2b8-4ae2-95ad-53c0b146d432","resolution":{"observed_at":"2026-08-15T20:01:49.139676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.609500Z","title":null,"venue":null,"work_id":"ffaf4273-a547-4f6d-a638-170f2a983245","year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.144556Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:6bb74dcd39620311a20e543e49eff82477a7b093a6d163fda77b5c7ef55b5a4f","observation_id":"5efbdb3e-32e9-4db1-8654-158543e4b8cd","resolution":{"observed_at":"2026-08-15T20:01:49.614416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.148863Z","title":"Zo-adamu optimizer: Adapting perturbation by the momentum and uncertainty in zeroth-order optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.148863Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:4cff61d36fe7d75f940be7a5c7574f0d945c73e3c4419485e09a6b250062752d","observation_id":"a91d7ad1-a24d-411e-9a32-e67aa4ccc14d","resolution":{"observed_at":"2026-08-15T20:01:49.148863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.153262Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.153262Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:63d01717b081651c864f47580dc00689d4b62daf05a3c3c5916f9589031d0123","observation_id":"7768c882-46e1-414c-93a9-9144506a315b","resolution":{"observed_at":"2026-08-15T20:01:49.153262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.157669Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.157669Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:e0383f52f859215e540f3491154777c6f39223f99015bca7eb52e6df72652187","observation_id":"aedd7ef9-44b2-4a5f-819f-58e8c45e8895","resolution":{"observed_at":"2026-08-15T20:01:49.157669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.161822Z","title":"A comprehensive linear speedup analysis for asynchronous stochastic parallel optimization from zeroth-order to first-order","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.161822Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:d1a1d1778b993aa97078b6a74890d0afb691125d75436aa90a75a4205e17b032","observation_id":"0472ceae-f71e-41f3-9a7e-cd3b86dc32cf","resolution":{"observed_at":"2026-08-15T20:01:49.161822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.166029Z","title":"Zeroth-order stochastic variance reduction for nonconvex optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.166029Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:ece753eb5ac35c456fdf5e4d0939fcf6578fc30053973701772005c0e9ae86a8","observation_id":"deac08bd-3a84-4784-8c8b-a93ee00214fa","resolution":{"observed_at":"2026-08-15T20:01:49.166029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.170334Z","title":"D., and Amini, L","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.170334Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:273a2ca56e63dcee7a8ca1df6d28703801665df28faece19cdf24c49685c6f18","observation_id":"1056cb1b-52fa-40bd-b8b5-babb558ca1c2","resolution":{"observed_at":"2026-08-15T20:01:49.170334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.174552Z","title":"D., Chen, D., and Arora, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.174552Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:57c4f074443e5e71310e70200cf40d2226542aacfec4bcee70644c91f34e1144","observation_id":"807eeac3-8367-4b56-9896-599f63173108","resolution":{"observed_at":"2026-08-15T20:01:49.174552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09261","last_updated":"2020-05-24T15:14:43Z","snapshot_observed_at":"2026-08-10T01:13:32.660024Z","submitted_at":"2020-05-19T07:44:52Z","title":"Adaptive First-and Zeroth-order Methods for Weakly Convex Stochastic Optimization Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09261","snapshot_observed_at":"2026-08-15T20:01:49.179179Z","title":"A., and Michailidis, G","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.179179Z"},"links":{"cited_paper":"/paper/2005.09261","citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:bf0adbabd222dc9362be3cbe267f880fa453e3fa5fd237b72d869a45f1927dfc","observation_id":"b782b7a7-0bc8-45ea-84d0-f66774cccf1f","resolution":{"observed_at":"2026-08-15T20:01:49.179179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.184001Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.184001Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:89ec95a2605d172675391ae208850d62ab521aed0644eba5a8e2c66c8969993e","observation_id":"660da4a9-e7c6-4086-9006-3e47a67ca1c7","resolution":{"observed_at":"2026-08-15T20:01:49.184001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-08-14T21:12:24.197125Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-15T20:01:49.188783Z","title":"Evolution strategies as a scalable alternative to reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.188783Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:e76bbf3d128d1f179db373402840089e17bb5e82e826ee1d09098b35ac6dd84d","observation_id":"35362983-5f3e-4cee-875e-5acfd01aad81","resolution":{"observed_at":"2026-08-15T20:01:49.188783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:01:49.193922Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.193922Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:ae7ee95169b49c58b1119861d941a7d20340f53a4eb93b7d2650227058d85b2c","observation_id":"78b1331c-1c10-4d4b-acb5-95f6a36e53c3","resolution":{"observed_at":"2026-08-15T20:01:49.193922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.198336Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.198336Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:4a8673460f2228ff63528384bdd92df52328f6fe160da515ea0d06cf7c0f43c0","observation_id":"7b6320ae-4819-4579-9929-5a605675ad8b","resolution":{"observed_at":"2026-08-15T20:01:49.198336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.202671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.202671Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:1ab8d4ae50ce24bcfad51f8aab50245b6b2d1503a7d8f2dbf0ac7c8a4f8f2827","observation_id":"383511d1-3dd7-49b8-98e1-353c28106c09","resolution":{"observed_at":"2026-08-15T20:01:49.202671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.499003Z","title":null,"venue":null,"work_id":"44125d9b-66d3-4a61-a709-79ad1e4564ed","year":2025},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.207074Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:02972e2dccd8bd114dca43ec2294df5e617b3a17f49ff01d50c6bedcf956bca2","observation_id":"625beb09-e378-4a5a-8fe4-d0dac29d17c6","resolution":{"observed_at":"2026-08-15T20:01:49.504641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.484798Z","title":"Refining adaptive zeroth-order optimization at ease","venue":null,"work_id":"236097bd-78a3-4b00-b6e7-5ec5c1fc56cd","year":2025},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.211212Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:99c1a26731798862fde4f4fdc460f7f9d58d9e7083abc2ce32dfb5b8f2695570","observation_id":"8e88b0b9-3d8a-443e-9f17-9b11cddd42df","resolution":{"observed_at":"2026-08-15T20:01:49.489376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.470550Z","title":null,"venue":null,"work_id":"c9c27ffe-0e43-48c6-b248-c0cddb8ad5ce","year":1981},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.215345Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:e91be73021a8bab07064a42020f7188dc37fa15d891be6742a06291fbc676cc5","observation_id":"6e2eec0a-2f67-437f-9ed8-24cb5f8dc79f","resolution":{"observed_at":"2026-08-15T20:01:49.475007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.454503Z","title":null,"venue":null,"work_id":"b85c1077-de8f-47bb-80c7-c79e32c8f90e","year":2018},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.219905Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:dc0e75f437c9c209f6e5a1e5184cb159f800546c8656c17048773826ecd448e3","observation_id":"f23354b2-faee-4bb9-8801-13d82c64ea10","resolution":{"observed_at":"2026-08-15T20:01:49.460226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.439344Z","title":"S., McAllester, D","venue":null,"work_id":"57fbb54c-07f4-48ef-bffd-f97808a2e73b","year":1999},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.224012Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:a637927184070510893a4bf0a01c7e0a76ebd264eb7be550eadd3d3d5ea56cd1","observation_id":"eb2008fe-d874-4fab-b4c8-ef20b93f322a","resolution":{"observed_at":"2026-08-15T20:01:49.444048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.424853Z","title":null,"venue":null,"work_id":"b49d5fbc-2e6a-409f-bf53-16e8ab7f7749","year":2019},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.228519Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:92649fc9405bbc438c925576bff133cb245c85dd7043ab299b48556e279b593c","observation_id":"c38af52c-b1ec-4742-8de2-b3e7b4bf6ab3","resolution":{"observed_at":"2026-08-15T20:01:49.429372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.410153Z","title":"Relizo: Sample reusable linear interpolation-based zeroth-order optimization","venue":null,"work_id":"4cef360b-c785-435f-a633-1b2d0cf4c697","year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.232722Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:795420bbe443b2c63afd9d7a20ac52d8e328f7df224f9f344d96e65639e57856","observation_id":"cf16f00e-702c-4924-8ded-f7f29b680fbc","resolution":{"observed_at":"2026-08-15T20:01:49.414797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.397045Z","title":null,"venue":null,"work_id":"5f82bda6-6865-43d1-a36d-a7fc2b69df5e","year":1992},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.236845Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:068d89f8c04665b73505e07de09442de9656191f6aa4cf8cb21eaeb065edc1a7","observation_id":"1bc51a29-afba-4a25-bd61-a026ff45eadb","resolution":{"observed_at":"2026-08-15T20:01:49.401236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.382767Z","title":"Unlocking black-box prompt tuning efficiency via zeroth-order optimization","venue":null,"work_id":"4acb9bd7-091d-42b7-baaa-b03a2f5ee112","year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.241034Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:e6b2f8ab96226e33e43aad5c0cafc2a62250412c0f8c96f4a925c17c352c232e","observation_id":"97591630-0fb9-467c-aa45-8281dc083863","resolution":{"observed_at":"2026-08-15T20:01:49.387452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.245350Z","title":"V., Mihaylov, T., Ott, M., Shleifer, S., Shuster, K., Simig, D., Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.245350Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:1b6a2cf58591e28cbbf922eb90bc32d90cf07cc6181cd0788718ea16d35f021f","observation_id":"005b513d-a0ed-44ea-b25d-87523409fdd1","resolution":{"observed_at":"2026-08-15T20:01:49.245350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.358876Z","title":"D., Yin, W., Hong, M., Wang, Z., Liu, S., and Chen, T","venue":null,"work_id":"442fc33d-15a7-4ef2-a25b-84f6a925bafe","year":2024},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.249420Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:5c35e1768750ce5051fdc2c51ead21a53ba43450ed80bc176b7d1af5c731e72a","observation_id":"cb4eac6f-8599-4272-b6b2-dab4fdefc14a","resolution":{"observed_at":"2026-08-15T20:01:49.363993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:01:49.342111Z","title":"Quzo: Quantized zeroth-order fine-tuning for large language models, 2025","venue":null,"work_id":"9d718cc5-d21b-459c-8648-04a128b90295","year":2025},"citing_paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:01:49.253498Z"},"links":{"citing_paper":"/paper/2506.14460"},"observation_digest":"sha256:d4a9aaa974b7f6e169f83b0b282dbf30a9e3d13c7756e6a8ef6b0179599cf2fd","observation_id":"c794e71c-7a65-4a33-83d1-bc8deeefc3f5","resolution":{"observed_at":"2026-08-15T20:01:49.348712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14460","last_updated":"2025-06-17T12:20:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T19:23:31.228513Z","submitted_at":"2025-06-17T12:20:04Z","title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 4 inbound Pith citation observations for arXiv:2506.14460."}