{"as_of":"2026-08-19T16:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b0a389d44bd8dd7d0c5ca6bcda22c88ee7d92909e7a5079a8ec9f837acc8ce1","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T14:45:07.168330Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:14:12.505221Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T20:52:58.379963Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"cited_work":{"arxiv_id":"2605.15412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15412","snapshot_observed_at":"2026-08-04T20:52:58.379963Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","venue":"cs.CE","work_id":"aafa056d-4d0d-407a-ad4e-a6498aa4138e","year":2026},"citing_paper":{"arxiv_id":"2608.01789","last_updated":"2026-08-03T07:02:24Z","snapshot_observed_at":"2026-08-15T07:15:03.734514Z","submitted_at":"2026-08-03T07:02:24Z","title":"Towards Autonomous Formulaic Alpha Discovery: An Evolutionary Computation Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:57.876245Z"},"links":{"cited_paper":"/paper/2605.15412","citing_paper":"/paper/2608.01789"},"observation_digest":"sha256:fb36a2ccd8a70516791a2af005c42f8a1be481121225ebb4983f820f939f9515","observation_id":"a75f6ec0-3312-45a6-8397-ec5e75bab7a9","resolution":{"observed_at":"2026-08-04T20:52:58.385612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15412","snapshot_observed_at":"2026-08-15T22:14:12.505221Z","title":"and Li, Ying , month = may, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12841","last_updated":"2026-08-17T23:50:10Z","snapshot_observed_at":"2026-08-19T16:22:01.016163Z","submitted_at":"2026-08-13T05:25:42Z","title":"AQuA: Recursively Self-Improving Quantitative Trading Research Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:14:12.505221Z"},"links":{"cited_paper":"/paper/2605.15412","citing_paper":"/paper/2608.12841"},"observation_digest":"sha256:0a04b2a81b8852887e868729b9a0810b29520c981397c56b0f4c59b427c9b706","observation_id":"015d67b1-8258-4a82-9c8d-b4c900f82cc0","resolution":{"observed_at":"2026-08-15T22:14:12.505221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.15412/citation-record","integrity":"/paper/2605.15412/integrity","json":"/paper/2605.15412/citation-record.json","paper":"/paper/2605.15412"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.08245","last_updated":"2020-04-04T04:27:45Z","snapshot_observed_at":"2026-08-19T14:44:26.097009Z","submitted_at":"2020-02-09T02:26:05Z","title":"AutoAlpha: an Efficient Hierarchical Evolutionary Algorithm for Mining Alpha Factors in Quantitative Investment","version":2},"cited_work":{"arxiv_id":"2002.08245","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.08245","snapshot_observed_at":"2026-06-29T17:03:41.240206Z","title":"AutoAlpha : an efficient hierarchical evolutionary algorithm for mining alpha factors in quantitative investment","venue":null,"work_id":"2532e1ad-4506-417d-a899-78b46ee21b47","year":2002},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2002.08245","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ee1150d4f6d7bc3feadc1957e8d34c80f7766839d1ce48737bce885a72fa8678","observation_id":"ad706de9-3d00-405e-affa-71e7dad3d3ce","resolution":{"observed_at":"2026-05-19T14:47:36.272401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00896","last_updated":"2024-12-01T17:13:54Z","snapshot_observed_at":"2026-08-15T07:32:48.553447Z","submitted_at":"2024-12-01T17:13:54Z","title":"Alpha Mining and Enhancing via Warm Start Genetic Programming for Quantitative Investment","version":1},"cited_work":{"arxiv_id":"2412.00896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00896","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpha mining and enhancing via warm start genetic programming for quantitative investment","venue":null,"work_id":"cdd0fd0e-7e06-4c7f-bce8-5a83aea938ea","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2412.00896","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:39cfe2f3bcfc0cda992060591b3c736a90b5a3ad7253501636f203715536ab7e","observation_id":"e781bf42-1358-4299-8970-2b8d308615ba","resolution":{"observed_at":"2026-05-19T14:47:36.266455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"101 formulaic alphas","venue":null,"work_id":"34c9c44d-62fd-4b59-bd2e-7a7dcd962d36","year":2016},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ae2297d57e9007181a1122afec5c9130af5ddaeda1b891cea590a599db9edc31","observation_id":"e21024ea-f425-4410-b0cf-d675a6fba8c8","resolution":{"observed_at":"2026-05-19T14:47:36.648682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiple regression genetic programming","venue":null,"work_id":"77642bbd-60fa-44eb-ac5a-7206585cc499","year":2014},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:13da9dd13da4a185210da81b6b4d0c00d57614d76220293d1ac16febb9042fc3","observation_id":"1175895f-f6de-4c91-92cd-a73ec512ccc3","resolution":{"observed_at":"2026-05-19T14:47:36.693887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpha discovery via grammar-guided learning and search","venue":null,"work_id":"cc15f612-d5ff-44bc-b244-150ad397b99c","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:a9266e546c209d82db1758eda7003baac7bf97de48172f230c25954bf332d6e7","observation_id":"54b6fef3-1146-4bbe-ae80-2d70a2e05c0e","resolution":{"observed_at":"2026-05-19T14:47:36.336651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Riskminer: Discovering formulaic alphas via risk seeking monte carlo tree search","venue":null,"work_id":"fb302e95-3edd-4798-a4e5-dc41e7a2bc00","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:f86028402647ff890a57d3834476d938cd965f9c29fc577d3c2517a06459b7ae","observation_id":"31cc164d-9f20-4563-b887-be948259d8cb","resolution":{"observed_at":"2026-05-19T14:47:36.621250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating synergistic formulaic alpha collections via reinforcement learning","venue":null,"work_id":"182be735-48bc-44cb-be5d-6cca4ec9d879","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:d0c725ab48ad9e8fd505e5e3d05751df86f70de5f2b0af0d6d5c84a049a93ac6","observation_id":"ffee040b-b83d-4847-b571-9887465c511a","resolution":{"observed_at":"2026-05-19T14:47:36.607853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16505","last_updated":"2024-06-26T07:40:12Z","snapshot_observed_at":"2026-08-17T06:33:09.959005Z","submitted_at":"2024-06-24T10:21:29Z","title":"$\\text{Alpha}^2$: Discovering Logical Formulaic Alphas using Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2406.16505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\\ text\\ Alpha \\ 2\\ : Discovering Logical Formulaic Alphas using Deep Reinforcement Learning , June 2024","venue":null,"work_id":"2a499182-3fe1-4708-9cc2-92bb809f27a2","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2406.16505","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:c0840bf1cb5a15d5d983c36b5d6d37b058a417d511d88a67f87f189a26a7f160","observation_id":"e4baaaae-e0f3-47c6-826a-6d6693f28192","resolution":{"observed_at":"2026-05-19T14:47:36.217241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphaqcm: Alpha discovery in finance with distribu- tional reinforcement learning","venue":null,"work_id":"d90eed5c-a9d7-4da5-877f-168193c12916","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:07258cdbccc77d9ff2eaef1da6eb0a892c5274002c601eb6c5b9c243984a5822","observation_id":"bd243977-0bc9-41db-a80a-f14fece1479a","resolution":{"observed_at":"2026-05-19T14:47:36.625169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphaforge: A framework to mine and dynamically combine formulaic alpha factors","venue":null,"work_id":"4ac31b6e-30ea-4198-ad1a-4d3356708397","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:926b5780f9dbb87a53e94bb6af33fdf48b0c2968824a7965087dd9a356d59134","observation_id":"ba3258be-e696-4aa8-b0ba-1edb0572ddb3","resolution":{"observed_at":"2026-05-19T14:47:36.644755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25055","last_updated":"2026-05-19T05:55:24Z","snapshot_observed_at":"2026-08-16T16:11:40.223372Z","submitted_at":"2025-09-29T17:06:07Z","title":"AlphaSAGE: Structure-Aware Alpha Mining via GFlowNets for Robust Exploration","version":3},"cited_work":{"arxiv_id":"2509.25055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25055","snapshot_observed_at":"2026-06-29T17:03:41.280933Z","title":"Alphasage: Structure-aware alpha mining via gflownets for robust exploration","venue":"q-fin.CP","work_id":"a605cb25-bcc8-4c33-bd2e-fb50c1cad7e5","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2509.25055","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:5bd3345d122c37e974aa7be55e96626fad3395fc80bbadc8b4f047dcd2675c59","observation_id":"bcbcdf6a-56ff-4321-9d10-842b64754d03","resolution":{"observed_at":"2026-05-20T02:04:45.338223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of aiops in the era of large language models","venue":null,"work_id":"65f236e9-3613-46a0-9e44-bbf1c76d220c","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:0ad0dda9b49af4ce433ad686f5cf6297659cf8136b1613224ccc819651a2e0f6","observation_id":"dec02696-8e36-4a3d-b868-8edfc9f5239e","resolution":{"observed_at":"2026-05-19T14:47:36.684134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E-log: Fine-grained elastic log-based anomaly detection and diagnosis for databases","venue":null,"work_id":"cdc9677c-6c73-456f-b349-911b46145415","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:fa9e90f9954571d6dbf206efc2af8d74fe74ccc4878faf4ea3d10542e1c7587b","observation_id":"0eec8e55-d3d9-4b5f-9eea-6eaba84072c1","resolution":{"observed_at":"2026-05-19T14:47:36.611877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards close-to-zero runtime collection overhead: Raft-based anomaly diagnosis on system faults for distributed storage system","venue":null,"work_id":"06fe48d2-304d-4c42-a25d-d4c0d626fcb3","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:28ab75bc583531615b4c51b16564e6eede123790b20a0cc61ecae460f934e118","observation_id":"dbde6636-c8d6-4f6f-a217-f0b67d1d6491","resolution":{"observed_at":"2026-05-19T14:47:36.617376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multivariate log- based anomaly detection for distributed database","venue":null,"work_id":"b1155a2a-acf2-4de9-b531-7d6d9b9867a3","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:6afc3210895669ba8b789b8b027ff4c21161eab1667d4ac371452f07484491f5","observation_id":"b225c227-f418-46b9-bbd1-8c8efe59ac6d","resolution":{"observed_at":"2026-05-19T14:47:36.652270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing events to augment log-based anomaly detection models: An empirical study","venue":null,"work_id":"76b291f1-51a9-4e01-9103-ad06c717d05f","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:a418c8a44ff1550e3a6eb877f89b4fd76c8eed5ba497a1749c5529cfa29f0fc3","observation_id":"e8cce409-02a4-4da9-bae1-736d4059cd47","resolution":{"observed_at":"2026-05-19T14:47:36.603732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalalog: Scalable log-based failure diagnosis using llm","venue":null,"work_id":"4b6ee2cd-777e-4b73-8441-b43ddad178bb","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:f9270fbb29ee17dfd6c368a2fceed62c13f0cf39dd9a8665d5f5923b0769e97b","observation_id":"7262480a-dbba-419b-bcc0-14443108ba16","resolution":{"observed_at":"2026-05-19T14:47:36.605748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06614","last_updated":"2025-04-09T06:18:24Z","snapshot_observed_at":"2026-08-16T12:42:48.374571Z","submitted_at":"2025-04-09T06:18:24Z","title":"AgentFM: Role-Aware Failure Management for Distributed Databases with LLM-Driven Multi-Agents","version":1},"cited_work":{"arxiv_id":"2504.06614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.06614","snapshot_observed_at":"2026-06-30T20:05:04.458204Z","title":"Agentfm: Role-aware failure management for distributed databases with llm-driven multi-agents","venue":null,"work_id":"b3398c5e-9739-451d-a61c-b93cd61cd7ac","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2504.06614","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:3e9252a138a6f6fffdd388a3bbfe60085fe0612d044e81772c6158cdf6deb636","observation_id":"bffb9279-de5b-4e4d-bfe3-d3b07fd8d513","resolution":{"observed_at":"2026-05-19T14:47:36.253998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.18776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:19:22.868903Z","title":"arXiv preprint arXiv:2504.18776 , year=","venue":null,"work_id":"a97d4e93-e2d4-4073-9b19-b5a669b49427","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:53c767490cbf16f41f9859b6169d70326cb99c3f0cded357f891c4a07d3e89e2","observation_id":"a8ea2feb-2f05-41c8-936e-0d9ca71d2598","resolution":{"observed_at":"2026-05-19T14:47:36.263109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02732","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T20:05:04.441628Z","title":"Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices","venue":null,"work_id":"1e43a2ae-6ff3-4162-8d98-b5c0d17c9d97","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:01122537e3218159ddf0052e539f4974e0dcf1d07126ed452959a54322949f77","observation_id":"cbed4980-c3c7-4275-b7b0-935ac356ba52","resolution":{"observed_at":"2026-05-19T14:47:36.230561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01676","last_updated":"2025-05-03T03:56:40Z","snapshot_observed_at":"2026-08-16T04:10:47.684758Z","submitted_at":"2025-05-03T03:56:40Z","title":"LogDB: Multivariate Log-based Failure Diagnosis for Distributed Databases (Extended from MultiLog)","version":1},"cited_work":{"arxiv_id":"2505.01676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01676","snapshot_observed_at":"2026-06-30T20:05:04.416165Z","title":"Logdb: Multivariate log-based failure diagnosis for distributed databases (extended from multilog)","venue":null,"work_id":"b3ac4569-c443-44fe-9271-9266025f8294","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2505.01676","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:7c2a387936cbb46fc5871a2b85cf7892e1ba96318278262af144fe2a5229cbf8","observation_id":"7510fb1b-d0b8-4f98-8ff8-d09fff1c83b0","resolution":{"observed_at":"2026-05-19T14:47:36.315659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xraglog: A resource- efficient and context-aware log-based anomaly detection method using retrieval-augmented generation","venue":null,"work_id":"f767d273-a17e-462e-9dcd-6cc36a1ca899","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:55ef4310fd01b6f948caae942fb7f3fe3c9464c3b90490345becabd2fac74b7a","observation_id":"51a10d05-bad2-4bed-ae36-158f68ecd2f1","resolution":{"observed_at":"2026-05-19T14:47:36.682246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08712","doi":"10.48550/arxiv.2508.08712","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on parallel text generation: From parallel decoding to diffusion language models","venue":"ArXiv.org","work_id":"5ed8cd4c-2414-4824-bac0-afafbb7ca3ec","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:b64db4eada69ac85d5fad6d99032c255096335d0b900bc60210e23c3349f2164","observation_id":"146b82ad-a823-4d51-9708-1dedeeb56e66","resolution":{"observed_at":"2026-05-19T14:47:36.320979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Time-tired compaction: An elastic compaction scheme for lsm-tree based time-series database","venue":null,"work_id":"b1c38874-ef59-4b9a-b14a-48ef9efe8298","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:68c0d33fb5fb03a27879ac0a19ecab48878ab98f4b7c73c7c04d7145fee8b55d","observation_id":"d2aeabda-f564-4e52-a0b1-1b231ea25bb7","resolution":{"observed_at":"2026-05-19T14:47:36.704664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:44:13.273232Z","title":"Separation or not: On handing out-of-order time-series data in leveled lsm-tree","venue":null,"work_id":"fd6a185e-1b51-4c86-9302-e8e54089e85d","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:b17ee23e0ee2800a14910e6a241db829064ca90a0a22101ca7225b6a447b5c47","observation_id":"cecef55d-a8ab-4323-980d-659d71de94ea","resolution":{"observed_at":"2026-05-19T14:47:36.710661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20370","last_updated":"2025-08-28T02:34:19Z","snapshot_observed_at":"2026-08-17T20:49:56.685963Z","submitted_at":"2025-08-28T02:34:19Z","title":"Adaptive Root Cause Localization for Microservice Systems with Multi-Agent Recursion-of-Thought","version":1},"cited_work":{"arxiv_id":"2508.20370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20370","snapshot_observed_at":"2026-07-03T02:17:34.802527Z","title":"Adaptive root cause localization for microservice systems with multi-agent recursion-of-thought","venue":null,"work_id":"330dca06-99e7-4df4-b980-1935d2cc7a89","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2508.20370","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:d4c63f7db3726f6972e0275fe57ed8c10927fefaf5c40db97869d56a2ae8fab1","observation_id":"b5a30f81-95e5-4415-be16-90a05fe64a64","resolution":{"observed_at":"2026-05-19T14:47:36.295516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ora: Job runtime prediction for high-performance computing platforms using the online retrieval-augmented language model","venue":null,"work_id":"72291c75-7465-4147-8b69-300850847706","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:220230c2200bb143b67ea6384bce95345c1feb74113f0698b11a826e1c48d775","observation_id":"293a8778-4fb8-403b-9aab-84eee2fa95ed","resolution":{"observed_at":"2026-05-19T14:47:36.712629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T20:05:04.403539Z","title":"Microremed: Benchmarking llms in microservices remediation","venue":null,"work_id":"c48f9b59-1cd9-4dd2-ac05-436fd53b08ab","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:20e0ad05c3b6cba81607b891b01cebeb0ab3d74c1c840157d16ea84f1f16aa64","observation_id":"be40c601-3745-4031-a8cf-d40a1e6c22ae","resolution":{"observed_at":"2026-05-19T14:47:36.331849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.844482Z","title":"arXiv preprint arXiv:2508.07173 , year=","venue":null,"work_id":"07ffe3d0-a60c-4fb1-99a5-8eedfc7a39cc","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:7a23c01c3677b7352a41a9aade04b96fe106ce2120042f78e8f532e259a9393a","observation_id":"02e9ae15-a085-4bf8-b708-c5388c5d870e","resolution":{"observed_at":"2026-05-19T14:47:36.281297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:19:43.675678Z","title":"Walk the talk: Is your log-based software reliability maintenance system really reliable?","venue":null,"work_id":"ed22221b-0118-440a-b5e0-ce9eab959f16","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ed846ef5c2d7bed3294734711573a7b395a5da4ee9eaceb8858b2b697c739d48","observation_id":"36013edc-89f9-439d-81b8-2ba86d44f319","resolution":{"observed_at":"2026-05-19T14:47:36.257289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09675","last_updated":"2026-05-13T05:10:13Z","snapshot_observed_at":"2026-08-11T01:39:37.105320Z","submitted_at":"2025-12-10T14:20:07Z","title":"d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models","version":3},"cited_work":{"arxiv_id":"2512.09675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09675","snapshot_observed_at":"2026-07-03T20:28:55.626839Z","title":"d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models","venue":"cs.CL","work_id":"f758ad04-0d63-48c2-ba04-6b73c214954c","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2512.09675","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:b8b207a3888d8f88efa3d18a9774d1654e31b71a1982ea34cef1a6db73812b38","observation_id":"71e4a089-2448-432b-a1d4-6acee72be0f2","resolution":{"observed_at":"2026-05-19T14:47:36.286767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cslparser: A collaborative framework using small and large language models for log parsing","venue":null,"work_id":"873d1ad2-c8d4-4b0a-99d7-f15cee7eab27","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:8de79c627cc88a4febf07f0171ccf4da6b61cc0b94b4a1a55003005aeb5a8b3f","observation_id":"b81409c5-5a0d-4953-a896-57420c71ff32","resolution":{"observed_at":"2026-05-19T14:47:36.676998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T20:05:04.481063Z","title":"United we stand: Towards end-to-end log- based fault diagnosis via interactive multi-task learning","venue":null,"work_id":"2dcd710b-9493-4271-b5de-f3f0f7d19f32","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:2610d322c613f41418bee8e8a9e37742cf3f767c8a4533ff260431f3348efa20","observation_id":"3d6c43c9-90a4-41bb-a5f2-25d05d183aa3","resolution":{"observed_at":"2026-05-19T14:47:36.209258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T20:05:04.396227Z","title":"Hypothesize-then-verify: Speculative root cause analysis for microser- vices with pathwise parallelism","venue":null,"work_id":"a029df8b-f688-41ce-b140-9dd71ea20fde","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:a8f75d3ff4378f5ecafb0c354373eaa0a0f888f5576df4b89cdd52308349e8a5","observation_id":"4ddcc394-6fb3-450c-b87c-b2dfb1885b5c","resolution":{"observed_at":"2026-05-19T14:47:36.243734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uda-rcl: Unsupervised domain adaptation for microservice root cause localization utilizing multimodal data","venue":null,"work_id":"cfa7a4a2-c8d3-44ba-984f-82f277ecaeca","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:0c62f0a1d347befcc7093f72eea9f79059b8023b034e9bd21df245dd96d93fdb","observation_id":"1c3cb501-4de4-4bc4-bd7a-1b923e0f2b38","resolution":{"observed_at":"2026-05-19T14:47:36.629412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aaad: Asynchronous inter-variable relationship-aware anomaly detection for multivariate time series","venue":null,"work_id":"241188f5-24fc-4c4f-99c5-4f45001545f2","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ad9f3df7161421938ce78133def221a380a20928735b685562f07c8a996364ef","observation_id":"0b112839-e8ac-4dae-a22a-177d80b8e05c","resolution":{"observed_at":"2026-05-19T14:47:36.619340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logaction: Consistent cross-system anomaly detection through logs via active domain adaptation","venue":null,"work_id":"d981cea5-b43e-4a57-861d-e59af5ce6a19","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:eba4a2f12d688123c53d65bd8a14faffd99710573bba881708ed8f4c98fd1997","observation_id":"803c6591-bdba-4362-a8dc-f4cb7c2120db","resolution":{"observed_at":"2026-05-19T14:47:36.623196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T20:05:04.401066Z","title":"Runtimeslicer: Towards generalizable unified runtime state representation for failure management","venue":null,"work_id":"2fa00aa5-8415-41a8-af2a-6a4d5db3d10d","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:8158fec6ce0cd8e64c1acc64ba045d2a74a53943b5b40e5434e52081a0ea4866","observation_id":"a914dd5a-e2e6-4d71-bc87-72b58fb5fa4e","resolution":{"observed_at":"2026-05-19T14:47:36.342208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.810630Z","title":"Efficient failure management for multi-agent systems with reasoning trace representation","venue":null,"work_id":"6568bb17-fcfc-47f7-ba1a-6ca5540ffebf","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ce7c6f2576d747f8ef78102c9fe81f18a426b1290c50e11b80468987c4d3388d","observation_id":"c5a91968-3e0f-4bb7-a8de-f55508b5c774","resolution":{"observed_at":"2026-05-19T14:47:36.212457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11094","last_updated":"2026-04-13T07:12:04Z","snapshot_observed_at":"2026-08-17T06:28:43.125862Z","submitted_at":"2026-04-13T07:12:04Z","title":"E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2604.11094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11094","snapshot_observed_at":"2026-06-30T20:05:04.428061Z","title":"E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning","venue":"cs.SE","work_id":"0a809569-861c-435b-8dd9-6597f46153d8","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2604.11094","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:079b0ea128d360a1b98683e449736688221dc4a1b5b3b143f2d0ceb9dda74976","observation_id":"79545063-c56f-426f-95f6-3602a32376a1","resolution":{"observed_at":"2026-05-19T14:47:36.289553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coorlog: Efficient-generalizable log anomaly detection via adaptive coordinator in software evolution","venue":null,"work_id":"2149b4aa-b52b-4826-ad40-8befdc15f586","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:cb4287c519dbb293aa4b3226eae44f5123ce7a7fd2e4cf917b895f68c7f5f117","observation_id":"d3f61822-85be-498e-8c91-77b0af6e515b","resolution":{"observed_at":"2026-05-19T14:47:36.639158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04431","last_updated":"2026-05-06T02:50:00Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:50:00Z","title":"Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2605.04431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04431","snapshot_observed_at":"2026-06-30T20:05:04.393794Z","title":"Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning","venue":"cs.SE","work_id":"c759d39f-1733-47df-8a6b-17fd4d201301","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2605.04431","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:a17a0ed97ea400e6aba10fb2db4bffab38788429d607aeb086c40ea1049a599c","observation_id":"62c3f35f-3748-4689-b30e-92f227fe6101","resolution":{"observed_at":"2026-05-19T14:47:36.250658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpha- gpt: Human-ai interactive alpha mining for quantitative investment","venue":null,"work_id":"ec482052-7ee6-4c51-bfab-adce628f2f16","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:5f14d38b9a2e7a9b0ae5bacafb61c24aafe6cc2350500e9ebad1e5270268be6b","observation_id":"ef387fb2-e226-413d-a45a-58775ef38089","resolution":{"observed_at":"2026-05-19T14:47:36.714573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can large language models mine interpretable financial factors more effectively? a neural-symbolic factor mining agent model","venue":null,"work_id":"67b63ddb-64a9-4393-adcd-997881ab4984","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ef73c26b85c590ad6af8f865c27087532df9592d7f55c6842fbf7aebd94e8b11","observation_id":"c7dec49a-8c68-41f3-92ac-9aa887f8d2a4","resolution":{"observed_at":"2026-05-19T14:47:36.633163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03755","last_updated":"2024-02-06T06:47:14Z","snapshot_observed_at":"2026-08-17T16:56:18.540944Z","submitted_at":"2024-02-06T06:47:14Z","title":"QuantAgent: Seeking Holy Grail in Trading by Self-Improving Large Language Model","version":1},"cited_work":{"arxiv_id":"2402.03755","doi":"10.48550/arxiv.2402.03755","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ni, and Jian Guo","venue":"arXiv (Cornell University)","work_id":"169b4b10-6015-4862-a2d3-e440ba0be84c","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2402.03755","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:1e17fbfe9f27b1246c888a2702dfee49884bd76f8ec5d4a365dd8faf930e04f0","observation_id":"ec5d7af7-bc6c-4748-a0e7-bbf54841cdcd","resolution":{"observed_at":"2026-05-19T14:47:36.325982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:22:59.943134+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:22:59.943134+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Al- phabench: Benchmarking large language models in formulaic alpha factor mining","venue":null,"work_id":"d9f2d1de-93e4-43d7-bc38-d8a875cbdc23","year":null},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:73efa693ec8f37e00cbaebc851739593e69ffceabf933a2cd48ad42012400fd4","observation_id":"00885b09-5999-43ce-a615-6645e3e3453b","resolution":{"observed_at":"2026-05-19T14:47:36.700082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphaagent: Llm-driven alpha mining with regularized exploration to counteract alpha decay","venue":null,"work_id":"13226fc1-563f-471f-8d3f-b4bfb356ebb6","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:7e6f7219928a9280dd4750ba3d255b19511f10e11fdb275ba61c8597cee04788","observation_id":"a55db157-cea9-457c-8142-9c3553a7daf3","resolution":{"observed_at":"2026-05-19T14:47:36.631321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Navigating the alpha jungle: An llm-powered mcts framework for formulaic alpha factor mining","venue":null,"work_id":"60508d7c-eff5-4d0f-a849-2bcf62eab19f","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:28ead56775aeae4dfb02b587b45ab86779d36deea5a9de83565ab8f2d218f935","observation_id":"a290ce47-72dd-4ce2-aa93-c54a4b1a2043","resolution":{"observed_at":"2026-05-19T14:47:36.701932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R&d-agent- quant: a multi-agent framework for data-centric factors and model joint optimization","venue":null,"work_id":"d5b29496-e705-4b59-b6b4-a72c8e8dcc2f","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:2b367bc04db96cf853e44675ff20facf7fd0ebf16772e46754725973a477798f","observation_id":"651fba28-30d7-47e5-9510-150ee0383d0b","resolution":{"observed_at":"2026-05-19T14:47:36.635051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07085","last_updated":"2026-04-22T04:21:51Z","snapshot_observed_at":"2026-08-19T06:34:01.788749Z","submitted_at":"2026-02-06T08:08:04Z","title":"QuantaAlpha: An Evolutionary Framework for LLM-Driven Alpha Mining","version":2},"cited_work":{"arxiv_id":"2602.07085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07085","snapshot_observed_at":"2026-06-29T17:03:41.292026Z","title":"QuantaAlpha: An Evolutionary Framework for LLM-Driven Alpha Mining","venue":"q-fin.ST","work_id":"d78e2a7f-c114-4a69-96d0-82b22f559606","year":2026},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2602.07085","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:cea7ef2e05043c947778efb8c8b9e492c90baf5f907b2ff8436ca71e6af1a3a1","observation_id":"455ff51a-0288-415d-a9fd-16ee47d07f08","resolution":{"observed_at":"2026-05-19T14:47:36.310589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T08:30:53.416562Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"36b2568e-2f2a-417a-8df0-1975a0dac597","year":2017},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:2c9de74ddb09b6580457173a2691cf7420650bf301e944f9630a4a9121b1cb5c","observation_id":"4e2037a5-a597-42fa-961c-1b8900f6032a","resolution":{"observed_at":"2026-05-19T14:47:36.637242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:b37029cc127e99fb5024d2ee9b2f491179d88a2b574ff384fa162650a45a7027","observation_id":"007c2136-f782-4ffd-a8c6-58988cf53fdd","resolution":{"observed_at":"2026-05-19T14:47:36.239121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:730a41a26ff600c27b255e78332d54bf9bcd9ce1c21c4bbfc73b420a09fc5412","observation_id":"5bdc8b63-09bb-4124-9919-2cbb136e32f1","resolution":{"observed_at":"2026-05-19T14:47:36.247436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"8775206f-563a-4c5f-a093-71b21b95eaa0","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:9e3c803bf03a0cfca58dd0f24b2ad5677f0cbb31dbd2884bf9edd6f1d3e7df1d","observation_id":"05b2011a-ab4d-4ba5-9c25-28fee6cb0c5d","resolution":{"observed_at":"2026-05-19T14:47:36.686482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:c9128a3d8cfb412510610e36d47128978af900003125048c9d5e97b403ff4c02","observation_id":"7f0d32ce-03ee-406e-aad1-4ae5d7fb3cce","resolution":{"observed_at":"2026-05-19T14:47:36.275263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language model agents in finance: A survey bridging research, practice, and real-world deployment","venue":null,"work_id":"8dba0986-731a-494c-b186-7c6ebe38c9f9","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:6686f90578250a678b14a9552db30c6a8342ebc8fff8cc8293cfbcd7746bdfc6","observation_id":"9d0fe3e8-af28-4be7-b8fd-4fec8dc024a9","resolution":{"observed_at":"2026-05-19T14:47:36.609754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ectsum: A new benchmark dataset for bullet point summarization of long earnings call transcripts","venue":null,"work_id":"a77c8b81-764c-400d-8704-675ffae80a01","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:5b07394259eb6dc184c5645d02e0679d84880b3ef73516c8a963d4a655422e08","observation_id":"f4702f7e-7bd3-4936-9ef8-6d649dd24be9","resolution":{"observed_at":"2026-05-19T14:47:36.642915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ab- stractive financial news summarization via transformer-bilstm encoder and graph attention-based decoder","venue":null,"work_id":"ead549ae-2a5b-4e36-985e-77b110c7fe52","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:7f755ffb5c212fa8f57475a2d1f375da0f4190bce07ac3384620932ffec87071","observation_id":"6e388a45-fe37-4315-b7e0-1a7f0e3a0e78","resolution":{"observed_at":"2026-05-19T14:47:36.706543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finred: A dataset for relation extraction in financial domain","venue":null,"work_id":"1d5579d3-91a9-4595-98d9-2bb6afcf89cf","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:d024689d2f1f9b5b4e9689eadce255d6187e51d7181590c3cb4a09d783bd9b37","observation_id":"30cb479c-64d6-4552-b948-feb20c8db348","resolution":{"observed_at":"2026-05-19T14:47:36.718588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finbert: A pre-trained financial language representation model for financial text mining","venue":null,"work_id":"cff5bc31-0c4a-4996-9043-58ba4845e64b","year":2021},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:bb6e6eabdc69c422643daec4a9c7d1a1ad977ee29048ecfd63c51ea31e55f5c6","observation_id":"3ed20da5-7ba5-4a7e-8c3a-4b1c0fa66307","resolution":{"observed_at":"2026-05-19T14:47:36.688371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":"2303.17564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-07-10T09:06:59.093499Z","title":"BloombergGPT: A Large Language Model for Finance","venue":"cs.LG","work_id":"04e9adc6-bece-4ff4-a0f6-e836d88414a7","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:aa2bf30125b8775fdc32f6f285c8ef852190f06875fcf0cb1d9a65866c31e44c","observation_id":"8d15e896-acde-4ef3-8f90-aea13c4d4da7","resolution":{"observed_at":"2026-05-19T14:47:36.260094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2306.06031","doi":"10.48550/arxiv.2306.06031","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fingp t: Open-source ﬁnancial large language models","venue":"arXiv (Cornell University)","work_id":"554b1dc5-f39a-4579-8ea8-a0de90c16870","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:9e668710880e878493dbd0fa43556ab3dfa301c010048bf857a7f07da49ca497","observation_id":"d529f88d-6074-4a06-8910-8ebedf170944","resolution":{"observed_at":"2026-05-19T14:47:36.224261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixiu: a large language model, instruction data and evalua- tion benchmark for finance","venue":null,"work_id":"1e9070e1-0d04-4051-a393-2ebf6a86a0f5","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:a1d40c29e6c9dbd3ce0cb4cc8467e8e6ca0c97b0503a861d4de5b3508a01c1a4","observation_id":"1a5d46e0-8d14-4462-91a2-321b132110d2","resolution":{"observed_at":"2026-05-19T14:47:36.690252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13064","last_updated":"2023-09-15T02:59:31Z","snapshot_observed_at":"2026-08-17T22:33:46.637845Z","submitted_at":"2023-09-15T02:59:31Z","title":"InvestLM: A Large Language Model for Investment using Financial Domain Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.13064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13064","snapshot_observed_at":"2026-06-30T13:24:40.014808Z","title":"Investlm: A large langu age model for investment using ﬁnancial domain instruction tuning","venue":null,"work_id":"87696d04-0f80-4cfb-aef4-10fed3b6b591","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2309.13064","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:c03dee215c192ce503291103018c62454b4c07d7246a077f5b2e4b203c792d2f","observation_id":"128cde12-d392-43dc-bc3a-4e71e3c7effa","resolution":{"observed_at":"2026-05-19T14:47:36.269386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fintral: A family of gpt-4 level multimodal financial large language models","venue":null,"work_id":"c8475af5-88a2-4d65-afad-ff192fce14bf","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:5bf969ba1ffa49ca80adbba91f7371d15c91b07b1a93333f3d6c0ebbffbf06a9","observation_id":"4dc23fde-bc29-4619-8321-39a964dc5eaa","resolution":{"observed_at":"2026-05-19T14:47:36.680248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06249","last_updated":"2024-08-16T12:30:07Z","snapshot_observed_at":"2026-08-16T14:11:12.559007Z","submitted_at":"2024-03-10T16:22:20Z","title":"No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks","version":3},"cited_work":{"arxiv_id":"2403.06249","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.06249","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"No language is an island: Unifying chinese and english in financial large language models, instruction data, and benchmarks","venue":null,"work_id":"a38b5b3b-24d1-4b29-97d2-f0721a18b24a","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2403.06249","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:2c94f35ef0a587e2c4b84981aad61bf834549caafcf615b32fc79b084a7f5f50","observation_id":"4396d6d8-cf5a-4891-aa9c-c2e22139932d","resolution":{"observed_at":"2026-05-19T14:47:36.301523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fednlp: an interpretable nlp system to decode federal reserve communications","venue":null,"work_id":"837a64b9-5e7f-4ab9-b5c6-3f0d9e97787a","year":2021},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:64de05e25ad177b4c82db85b1d61ad9a73894bc9f83370daf971b7eaf2a47a0b","observation_id":"ba328254-a753-4da0-8037-53ec4e882af3","resolution":{"observed_at":"2026-05-19T14:47:36.692092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trillion dollar words: A new financial dataset, task & market analysis","venue":null,"work_id":"c143ee91-f947-4c22-ab4a-f549e2032e13","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:aa83555387fdc37189ead5604c4ba9cc74275e1a7eaf40737d0a05759dd59148","observation_id":"b863898c-4775-4238-be4c-ced62623959a","resolution":{"observed_at":"2026-05-19T14:47:36.698218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Impact of news on the commodity market: Dataset and results","venue":null,"work_id":"20189b77-132a-49b6-822b-194f5fe86db5","year":2021},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:30a3fc0829124531230a31d4afdd8d1f3328afccddfc38ef319d469382cd1498","observation_id":"7585ef5b-6ebb-449f-b62b-65e776718e4c","resolution":{"observed_at":"2026-05-19T14:47:36.695810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harnessing llms for temporal data-a study on explainable financial time series forecasting","venue":null,"work_id":"aab5d8ba-5c84-4ed7-b2e3-b4bf1dda51b9","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:1c1b25fff0bc1f1397fed4647e9aaf51feae9c5591c5e0773d19e0ddcd7f8c38","observation_id":"15ccc756-9e46-4bb0-abc3-b74266131a94","resolution":{"observed_at":"2026-05-19T14:47:36.708879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18834","last_updated":"2026-06-01T07:37:08Z","snapshot_observed_at":"2026-08-16T12:55:08.646938Z","submitted_at":"2025-02-26T05:19:16Z","title":"FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting","version":3},"cited_work":{"arxiv_id":"2502.18834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18834","snapshot_observed_at":"2026-07-04T16:09:56.460155Z","title":"FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting","venue":"cs.CE","work_id":"d7f78192-6c51-4904-a865-ebb82664e81a","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2502.18834","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:91c9642af5129fcbb1dffaf9f898642c62acdeeb35e3dd0814a2dada5511cf26","observation_id":"ea6fae76-7cd6-435e-b7a6-7c66b4c731b4","resolution":{"observed_at":"2026-05-19T14:47:36.236103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03079","last_updated":"2023-09-06T17:18:55Z","snapshot_observed_at":"2026-08-16T15:02:45.832982Z","submitted_at":"2023-09-06T17:18:55Z","title":"GPT-InvestAR: Enhancing Stock Investment Strategies through Annual Report Analysis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2309.03079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.03079","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-investar: Enhancing stock investment strategies through annual report analysis with large language models","venue":null,"work_id":"3980a9be-390f-4e11-9502-c1307a6a10f5","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2309.03079","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:c71d6b95f2eb8ac6ae30b48f0c3f9b5169d2639a20ebc5038850be0b3c17def7","observation_id":"ec45ee6e-b130-4635-87f0-6dc9ceebacd6","resolution":{"observed_at":"2026-05-19T14:47:36.306912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finben: A holistic financial benchmark for large language models","venue":null,"work_id":"da99766f-9200-4a34-8030-35bcbe7a2252","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:6062309dc4321846346a578cd36d5608a275a74f46ff5dcc4eba04d03f3d528b","observation_id":"8bf974c8-aaeb-42a8-a378-31e23e86eac9","resolution":{"observed_at":"2026-05-19T14:47:36.654130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investorbench: A benchmark for financial decision-making tasks with llm-based agent","venue":null,"work_id":"e0d97b8b-457f-45cf-ad92-54da1e811f34","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:caf8779bed1b28d6883a95482b76091fd9b6a3b7d255cdc0d5857e8e9fdb8bb1","observation_id":"40a7e525-b480-4997-935a-105273cbf5b9","resolution":{"observed_at":"2026-05-19T14:47:36.614736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Strux: An llm for decision- making with structured explanations","venue":null,"work_id":"b8a6279a-6fbc-4bb3-9c4b-94d9d0611bf8","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:502847e44cc337132aba87ac99a2d6bef99b4a5e4b7844948bfbfc7ab122265e","observation_id":"f1d75017-7511-4705-8df4-9700e1c982c2","resolution":{"observed_at":"2026-05-19T14:47:36.658442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finmem: A performance-enhanced llm trading agent with layered memory and character design","venue":null,"work_id":"92b3ddeb-15b7-4434-b7b4-e63eab9b9689","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:d94139aede8e524853f5f35060eefbbf6017930067e3905c8efd8327ada35b30","observation_id":"39f4cd51-20e1-4ae7-a915-383e9fb0d46b","resolution":{"observed_at":"2026-05-19T14:47:36.716791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10654","last_updated":"2023-09-22T09:52:07Z","snapshot_observed_at":"2026-08-18T20:19:48.631559Z","submitted_at":"2023-09-19T14:34:01Z","title":"CFGPT: Chinese Financial Assistant with Large Language Model","version":2},"cited_work":{"arxiv_id":"2309.10654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10654","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cfgpt: Chinese financial assistant with large lan- guage model","venue":null,"work_id":"d12aff1a-7650-4497-85e1-b2226a6139e3","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2309.10654","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:314cf71395cd383f794f41d8907212b200963aef0e0849ed9e2b20d65fb39fd9","observation_id":"e25a5035-417d-4eb6-8e41-dc0f89be25e1","resolution":{"observed_at":"2026-05-19T14:47:36.283958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18957","last_updated":"2026-06-23T04:46:28Z","snapshot_observed_at":"2026-08-18T00:09:04.622381Z","submitted_at":"2024-07-15T06:49:30Z","title":"When AI Meets Finance (StockAgent): Large Language Model-based Stock Trading in Simulated Real-world Environments","version":5},"cited_work":{"arxiv_id":"2407.18957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18957","snapshot_observed_at":"2026-07-02T21:37:25.649537Z","title":"When ai meets finance (stockagent): Large lan- guage model-based stock trading in simulated real-world environments","venue":"q-fin.TR","work_id":"1bb27e2b-ad5c-4c9e-94c4-daad186c24ab","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2407.18957","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:b4840e82cead1daf6f454cea8c085769c41839dad7d765081a947010bd0c786d","observation_id":"917f3932-ecdb-48c5-a090-434528d50501","resolution":{"observed_at":"2026-06-24T02:14:19.804532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tradingagents: Multi-agents llm financial trading framework","venue":null,"work_id":"680455b3-9bf1-4e35-824b-a95870d890ad","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:4c525ede0db683252c2feb03790ee67bd16405db9c45371be39bde419abb94c8","observation_id":"abbc0d37-cebd-456a-8597-73cefdbd7a38","resolution":{"observed_at":"2026-05-19T14:47:36.650516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convfinqa: Exploring the chain of numerical reasoning in conversational finance question answering","venue":null,"work_id":"05ae99ea-d064-4893-bf34-4e05775a97c3","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:7da93fa4e2ca924e098064fca33ac91c1d6d14c0671900985ebd940d4a369723","observation_id":"e9673466-28c8-40fa-b6be-dce388eed046","resolution":{"observed_at":"2026-05-19T14:47:36.656177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finder: Financial dataset for question answering and evaluating retrieval-augmented generation","venue":null,"work_id":"ec71c26f-e492-4658-abb6-933a56e5a1c5","year":2025},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:ed5cec9fa0e32bdbcaf02d03097b0036083e42a3b9eb4ce27970413b7a2ce807","observation_id":"5974c9a5-044a-4210-b56d-295450fafa58","resolution":{"observed_at":"2026-05-19T14:47:36.641052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Al- phafin: Benchmarking financial analysis with retrieval-augmented stock- chain framework","venue":null,"work_id":"014e587b-17c1-49a5-b355-66b69e32d020","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:d181c80fa01110c8d3c9cc5668f999bd4cd2ab818d311d69a66f32773ed98cdf","observation_id":"8d8394bc-33bf-42cf-b0ed-e3379b17d7e1","resolution":{"observed_at":"2026-05-19T14:47:36.646803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Substituting human decision- making with machine learning: Implications for organizational learning","venue":null,"work_id":"a3e4f452-de64-4cbd-8baf-0f5ff57ee1f4","year":2022},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:c0e0bb826f1237487962efded232c3d2e54943c27127a24563b0dbc639ca735f","observation_id":"11e9a090-f8ff-4b8e-9d4f-449edc6a637f","resolution":{"observed_at":"2026-05-19T14:47:36.627568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00065","last_updated":"2023-07-22T09:27:05Z","snapshot_observed_at":"2026-08-16T15:14:09.942255Z","submitted_at":"2023-07-22T09:27:05Z","title":"FinPT: Financial Risk Prediction with Profile Tuning on Pretrained Foundation Models","version":1},"cited_work":{"arxiv_id":"2308.00065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00065","snapshot_observed_at":"2026-07-03T04:47:38.126791Z","title":"Finpt: Financial risk prediction with profile tuning on pretrained foundation models","venue":null,"work_id":"49a60c3d-d8bb-41d5-8dca-f90c28fb28c1","year":2023},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2308.00065","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:561715057865c430293e4750fbdfdf4e49f02826aaeed5b95cc5ae3ccb2cebef","observation_id":"70ef0511-6a29-414b-9bb8-d5e933044967","resolution":{"observed_at":"2026-05-19T14:47:36.292296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00566","last_updated":"2024-02-18T01:24:17Z","snapshot_observed_at":"2026-08-16T14:56:10.678984Z","submitted_at":"2023-10-01T03:50:34Z","title":"Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.00566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00566","snapshot_observed_at":"2026-07-03T04:47:38.129160Z","title":"Empowering many, biasing a few: Generalist credit scoring through large language models","venue":null,"work_id":"309c170a-4c9d-43e5-8a9a-5a20599143b6","year":2024},"citing_paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T14:45:07.168330Z"},"links":{"cited_paper":"/paper/2310.00566","citing_paper":"/paper/2605.15412"},"observation_digest":"sha256:6917d09ec4956166fb9eb2a45f52a65047695491caa90faf31d2dec47809a72a","observation_id":"b5a6723b-53a0-42af-84ef-c46f364078bd","resolution":{"observed_at":"2026-05-19T14:47:36.221245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.15412","last_updated":"2026-05-14T20:54:40Z","latest_version":1,"primary_category":"cs.CE","snapshot_observed_at":"2026-08-17T04:53:15.890116Z","submitted_at":"2026-05-14T20:54:40Z","title":"From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":49},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2605.15412."}