{"as_of":"2026-08-07T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9809f73bb2d1a096731b52d9570b2008bba88a4bd6d23894865f6500fa1f2d12","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:48:53.428642Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:18:08.986666Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T21:50:41.269928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20263","snapshot_observed_at":"2026-08-05T22:18:08.986666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13174","last_updated":"2026-06-02T13:19:43Z","snapshot_observed_at":"2026-08-05T22:18:07.836681Z","submitted_at":"2025-08-10T11:19:24Z","title":"AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:08.986666Z"},"links":{"cited_paper":"/paper/2507.20263","citing_paper":"/paper/2508.13174"},"observation_digest":"sha256:cad2fbe8afd8df6d74ded4f62ebfdb74e9ce0be3eaa86477eae1432d0cb433ce","observation_id":"61e2ad78-4e4d-472b-a5d8-ecbb876efbb6","resolution":{"observed_at":"2026-08-05T22:18:08.986666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"cited_work":{"arxiv_id":"2507.20263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from expert factors: Trajectory-level reward shaping for formulaic alpha mining","venue":null,"work_id":"d334e810-e6d7-435d-ab18-45165eca9cde","year":2025},"citing_paper":{"arxiv_id":"2509.25055","last_updated":"2026-05-19T05:55:24Z","snapshot_observed_at":"2026-07-06T22:31:05.409865Z","submitted_at":"2025-09-29T17:06:07Z","title":"AlphaSAGE: Structure-Aware Alpha Mining via GFlowNets for Robust Exploration","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-21T21:50:26.812048Z"},"links":{"cited_paper":"/paper/2507.20263","citing_paper":"/paper/2509.25055"},"observation_digest":"sha256:ba957ac61a411874e289285f33f648aa1eb6e96eeb04086fb7e49b5457a3e186","observation_id":"2a23f9dc-83e3-4267-853f-68157115cbbf","resolution":{"observed_at":"2026-05-21T21:50:41.272196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20263/citation-record","integrity":"/paper/2507.20263/integrity","json":"/paper/2507.20263/citation-record.json","paper":"/paper/2507.20263"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:04.301964Z","title":"Saoftrl: A novel adaptive algorithmic framework for enhancing online portfolio selection,","venue":null,"work_id":"1208f2db-4b8e-408b-b0c3-64ca69c9b994","year":2024},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:47.741499Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:ffee0cd15ac370303c319b6ae864c0bb46c54537960cc4f856685f58cf48152d","observation_id":"7a36d74d-66cc-4f0e-a60e-5c37ec5070c1","resolution":{"observed_at":"2026-08-06T13:49:04.411240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:03.760252Z","title":"Optimal mean-reverting port- folio with leverage constraint for statistical arbitrage in finance,","venue":null,"work_id":"05dc002b-18b1-488e-8702-0c1e70b17e8f","year":2019},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:47.852555Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:60d07f300672622140dad180d03272e3ed0a6c7e48a79e196c3b7bfa779cb642","observation_id":"16135359-ee9c-4f15-bf34-25c0f2619ffc","resolution":{"observed_at":"2026-08-06T13:49:03.960343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:03.424741Z","title":"Mean-reverting portfolio with budget constraint,","venue":null,"work_id":"67140431-05a0-4e92-b0b6-d04e3b80c1cd","year":2018},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:47.994744Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:365f207e29cd139fac060c97bcc998276a82cd2ef0c31c5b67250c3210ba103f","observation_id":"53ad42d5-1485-45bd-bf66-d6d71076d018","resolution":{"observed_at":"2026-08-06T13:49:03.604744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:48.094742Z","title":"101 formulaic alphas,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.094742Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:04d2da0469cd109bbf5850812f6dd9ccf8b4a97de7894cbb02fed30d0928f633","observation_id":"ab21ba52-0414-46f8-9ce4-45aacf6dce32","resolution":{"observed_at":"2026-08-06T13:48:48.094742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:03.093215Z","title":"Openfe: automated feature generation with expert-level per- formance,","venue":null,"work_id":"9674e345-fdf1-42d8-81dd-895c6928ea72","year":2023},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.214751Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:7dae0a64d44ad75314cf05b7c30fa63842ee9335308c1ec4854e8b611c88c67b","observation_id":"a0dbdf02-4e7e-4390-b368-1592c8646543","resolution":{"observed_at":"2026-08-06T13:49:03.228335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:02.824452Z","title":"Application research of the xgboost-svm combina- tion model in quantitative investment strategy,","venue":null,"work_id":"a4d86753-5139-47d0-92c5-923c4a798a38","year":2022},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.384736Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:bb565811c5be359834306f22de7544f5087ee56e36544d607d3857b716e9a694","observation_id":"8d69ac73-27c3-4962-b659-3ab4b551729f","resolution":{"observed_at":"2026-08-06T13:49:02.964752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:02.494748Z","title":"Research on multi factor stock selection model based on lightgbm and bayesian optimization,","venue":null,"work_id":"1c238710-2666-47d2-9329-a7b5d9a58fef","year":2022},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.565998Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:90f6c749652ca6fd20dfb58a8eead662f4956d2df017fd495d7373b96c39e1f7","observation_id":"486158a6-06ee-4abb-9bb4-c21b72778388","resolution":{"observed_at":"2026-08-06T13:49:02.664884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:02.050915Z","title":"Accurate label refinement from multiannotator of remote sensing data,","venue":null,"work_id":"ac042c4b-6a6e-4911-b629-cd52d04f9711","year":2023},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.694745Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:69925091546041310596f5f82f59ed1e39a609b3d53250940d8e19266d775450","observation_id":"60edc6d0-f206-4439-85ab-08c73374a2b1","resolution":{"observed_at":"2026-08-06T13:49:02.254823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:01.518601Z","title":"Multiscale temporal dynamic learning for time series classification,","venue":null,"work_id":"8998533a-f68a-4ae7-9973-7892d76e98c5","year":2025},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.785533Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:a2a5ad8f04a25803fb61503d1f102fa6071cec74439e90b4c303ee6c4f695741","observation_id":"cb86c464-54dc-4237-8caa-b7cff736a199","resolution":{"observed_at":"2026-08-06T13:49:01.902712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:01.143295Z","title":"Q-learning-based spec- trum access for multimedia transmission over cognitive radio networks,","venue":null,"work_id":"fcf1a9f3-6ae4-44c8-8afc-4557a83b38ae","year":2020},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.879079Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:faba8125baa434e30d994fbc16f129349c51184d58b0bef8c5017d12288b5728","observation_id":"036482ee-bd23-4c57-ade5-f5d9da87cdce","resolution":{"observed_at":"2026-08-06T13:49:01.292961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:48.963793Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:48.963793Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:04c0dc09129d11e4eaa84a8304ea1c4059e6cc3612887fd93ecf94a96dc0b664","observation_id":"bf5da443-33a6-4069-9516-0edf13908587","resolution":{"observed_at":"2026-08-06T13:48:48.963793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:49.055347Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.055347Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:b09904b19e9d1626a0a667254eb8e8fd8b00cc1280bc3a933cbe2db5aeec1fee","observation_id":"7b24b2b6-6699-41f1-8bb8-869ca23c3d63","resolution":{"observed_at":"2026-08-06T13:48:49.055347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:00.564742Z","title":"Prediction of small-molecule compound solu- bility in organic solvents by machine learning algorithms,","venue":null,"work_id":"bf47a503-126f-4d3d-907e-568b4be66617","year":2021},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.264819Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:d76a8b3f006e16f0005b7084eebd66ae8207bcdc2580d03770031589724e1cf6","observation_id":"43612792-4c59-4de3-a1ea-7df139eed65e","resolution":{"observed_at":"2026-08-06T13:49:00.794875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08245","last_updated":"2020-04-04T04:27:45Z","snapshot_observed_at":"2026-07-06T08:58:30.718035Z","submitted_at":"2020-02-09T02:26:05Z","title":"AutoAlpha: an Efficient Hierarchical Evolutionary Algorithm for Mining Alpha Factors in Quantitative Investment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08245","snapshot_observed_at":"2026-08-06T13:48:49.421415Z","title":"Autoalpha: an efficient hierarchical evolutionary algorithm for mining alpha factors in quantitative invest- ment,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.421415Z"},"links":{"cited_paper":"/paper/2002.08245","citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:1dd5e12fbf4195c17aa0b84c301aaf0b2304373734d5885b59a12992d17dcd3e","observation_id":"55a8ee4b-abb9-4203-95c2-600527580a30","resolution":{"observed_at":"2026-08-06T13:48:49.421415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:49:00.247554Z","title":"Generating synergistic formulaic alpha collections via reinforcement learning,","venue":null,"work_id":"acdc6641-4154-451b-992e-804a058a600f","year":2023},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.564867Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:945e74e316d1c477836ab99d63660a694c57ff9260863ccfeca656526fc1aec5","observation_id":"26380ba5-91dc-47eb-9a9a-7e5ff4d272be","resolution":{"observed_at":"2026-08-06T13:49:00.324938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:59.944995Z","title":"Quantfactor reinforce: Mining steady formulaic alpha factors with variance-bounded reinforce,","venue":null,"work_id":"113deadf-a0f4-4f75-8904-0635522e07aa","year":2025},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.666050Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:3429daf2fb2e7c970112fbf4c4847ba8272ba00aa268db332d2871647f6e88d5","observation_id":"02cae88a-96b7-475c-8bdf-b4326deaf14c","resolution":{"observed_at":"2026-08-06T13:49:00.038201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:59.664935Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":"f2affc9a-5aa8-44bc-882c-0f19e573620a","year":1999},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:49.727728Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:7a841d042d86a213cea720c6a4cae36cd8c5eeb8b769de4de9659d5e102efab6","observation_id":"7377c4fb-69fe-4c11-9d00-a0aaeb270c26","resolution":{"observed_at":"2026-08-06T13:48:59.762606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:59.324981Z","title":"Principled methods for advising reinforcement learning agents,","venue":null,"work_id":"f40d2eba-9417-4875-bb87-0527ec948fa4","year":2003},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:50.105446Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:b946b29e7117b9f74ac42990314d123b36a846e52d1ee239faba5fab8733875a","observation_id":"93556ff4-5f0b-427a-913e-001b6432cd63","resolution":{"observed_at":"2026-08-06T13:48:59.423356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:58.978522Z","title":"Reinforcement learning from demonstration through shaping,","venue":null,"work_id":"f982338d-f7c2-4012-b250-955d1cfa2019","year":2015},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:50.322048Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:00c998a9861fa9f6afc9b9ca639c71d5f118d4f9b9cf7fa84af37d2b03105a9d","observation_id":"3f270989-9353-4c1d-9951-76935d2d7ce9","resolution":{"observed_at":"2026-08-06T13:48:59.152060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:58.491366Z","title":"Artificial intelligence stock selection: Generalized linear model,","venue":null,"work_id":"02cf3097-19ef-468d-8e38-f4a6d8cc0d3a","year":2017},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:50.464743Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:089689d50a90824f0d13ffa7da8f7abe64d4882aed26879a44d4515f99573812","observation_id":"36b87f15-58b1-40f1-b09a-e397ac252259","resolution":{"observed_at":"2026-08-06T13:48:58.644740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T13:48:50.674812Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:50.674812Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:e63da4ea9f945f875a4c3403ddeee1e7ce78e8841b39af34bbbdb3592821fc2c","observation_id":"37ca507a-aa80-42e8-bc63-1dcb26d9c0b5","resolution":{"observed_at":"2026-08-06T13:48:50.674812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:57.981479Z","title":"Robot shaping: Developing autonomous agents through learning,","venue":null,"work_id":"5c55caa7-1388-4d01-9b4f-ad68d197457b","year":1994},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:50.824821Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:48b271ead1abbe5fd97d8dd24ceef370811facb993fb7ac300f18eff9e67c4a3","observation_id":"4fb1fb80-4375-4499-b491-c7e16d1b0268","resolution":{"observed_at":"2026-08-06T13:48:58.257666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:57.555238Z","title":"A cold-start-free reinforce- ment learning approach for traffic signal control,","venue":null,"work_id":"4a87cf91-b0b0-4839-ad75-a35f78eab44b","year":2022},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.074757Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:42ee3312e44943ca81ca73eedb741f6d7fa4acdfb02224fcbc00c1608424a2ad","observation_id":"35598bd5-1049-460a-aa2d-4abb6dca4ec1","resolution":{"observed_at":"2026-08-06T13:48:57.724864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:51.182953Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.182953Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:dd6d7571b17182f1011eb32313f0af9073034f7022585c0e5c01b10dd49cbe7d","observation_id":"92b1661f-b6e2-4171-9808-0923a857b095","resolution":{"observed_at":"2026-08-06T13:48:51.182953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:57.132443Z","title":"The arcade learning environment: An evaluation platform for general agents,","venue":null,"work_id":"3519daba-b7f4-4ad3-9b7e-02c837023953","year":2013},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.358935Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:8d0c03770a24375e6d381fdb0e4a9cff613251f452de2c979b78d8b0d887ead4","observation_id":"a603f713-12fa-4d21-85e7-904567d212b5","resolution":{"observed_at":"2026-08-06T13:48:57.274870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:51.528680Z","title":"A survey of robot learning from demonstration,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.528680Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:2a13596524cc913257cec3c7644f22958bac0782097022a4011861845fd93a68","observation_id":"c67883d7-dc90-412b-852f-80a70cf81382","resolution":{"observed_at":"2026-08-06T13:48:51.528680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:56.664872Z","title":"Apprenticeship learning via inverse rein- forcement learning,","venue":null,"work_id":"3cef3675-8c1b-4032-ba97-eb3199f6f9b2","year":2004},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.712407Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:291945e80c13a715975d2f56d652d9f05ef71590f457e9c4f5a39b6ffc7a2e79","observation_id":"7a080c92-d815-453d-93ec-ed7e9b297bc1","resolution":{"observed_at":"2026-08-06T13:48:56.773524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:56.154743Z","title":"Multi-resolution exploration in continuous spaces,","venue":null,"work_id":"6e0aa7fe-3923-4fab-aea5-3d8b646923cf","year":2008},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.851333Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:aef8fc2f57b70d072737b1da620a3067f3366df64364b55e85f9a49560780ed5","observation_id":"298f04dc-ee4c-43b2-a040-7f473ed3b31f","resolution":{"observed_at":"2026-08-06T13:48:56.324818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:55.794907Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"b3f200a0-8c46-4153-ac25-f5e834c91878","year":2008},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:51.934751Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:ae8f56f6f06f186f6cfbcb7a2786e492b012fbec0f8e7998cbb31f2de714a894","observation_id":"cb283bbb-adf1-449b-9f61-4cdf92d2d4c5","resolution":{"observed_at":"2026-08-06T13:48:55.934811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:55.456145Z","title":"From mimic to counteract: a two-stage reinforcement learning algorithm for google research football,","venue":null,"work_id":"e62dc426-54eb-44a9-9eed-6de82ab93708","year":2024},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:52.074825Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:145bfdba5f297b98ccbc7ab7b2da289b140dd8a795c935c308385c42aebc4c51","observation_id":"2b7c45cc-fe2f-4be4-a79b-4aa3dca2b0cd","resolution":{"observed_at":"2026-08-06T13:48:55.569341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:55.134942Z","title":"Learning continuous semantic representations of symbolic expressions,","venue":null,"work_id":"de0171d5-17ed-4b5e-9c23-731db060cf0b","year":2017},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:52.201721Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:44aad89dd65fa24e6be9a3e7842e5682c00cebd5a630797404b4fde2febcc011","observation_id":"59420191-8ae8-4c6a-afd2-a5b37e8bde14","resolution":{"observed_at":"2026-08-06T13:48:55.306444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09999","last_updated":"2024-10-30T14:18:42Z","snapshot_observed_at":"2026-07-06T18:15:11.806744Z","submitted_at":"2024-05-16T11:33:49Z","title":"Reward Centering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09999","snapshot_observed_at":"2026-08-06T13:48:52.362113Z","title":"Reward centering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:52.362113Z"},"links":{"cited_paper":"/paper/2405.09999","citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:7d52e61dead4fbb4683d6793edb786a986cea591cdee256d8f9379214bd7603d","observation_id":"4535117f-df57-4af2-9837-47ca0f6d0c85","resolution":{"observed_at":"2026-08-06T13:48:52.362113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:54.587504Z","title":"Stephens","venue":null,"work_id":"1ad822b9-3479-4c5e-b8b5-e3c10ebbb124","year":2015},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:52.604818Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:fe5d09c60bf3f6731bad255e9753386377726cebfe63ad6bb715bd6677827405","observation_id":"12339e63-7eb3-406c-ab15-0c32841767ec","resolution":{"observed_at":"2026-08-06T13:48:54.914859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:53.135126Z","title":"Stable-baselines3: Reliable reinforcement learning implementa- tions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:53.135126Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:66012a2512f03f3b082da548030866d4a077320cd4fcf31e0bf47097f1b91634","observation_id":"6f2afa1e-a017-463f-96f4-0b212e195ba7","resolution":{"observed_at":"2026-08-06T13:48:53.135126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11189","last_updated":"2020-09-22T12:57:10Z","snapshot_observed_at":"2026-08-07T09:13:43.020946Z","submitted_at":"2020-09-22T12:57:10Z","title":"Qlib: An AI-oriented Quantitative Investment Platform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11189","snapshot_observed_at":"2026-08-06T13:48:53.229166Z","title":"Qlib: An ai-oriented quantitative investment platform,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:53.229166Z"},"links":{"cited_paper":"/paper/2009.11189","citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:47a952b91ea86b800233ae76e25888abb04f6d563c25fd64049df003d59677fa","observation_id":"cbdf4205-1c33-452d-aff4-f66689ea37fe","resolution":{"observed_at":"2026-08-06T13:48:53.229166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:53.428642Z","title":"Learning repre- sentations by back-propagating errors,","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:53.428642Z"},"links":{"citing_paper":"/paper/2507.20263"},"observation_digest":"sha256:2e0d60122c966cbe1dff55e5af817084b05431b3cd20bcd9ade94671ee56b577","observation_id":"d87a0eba-9268-4cb5-8535-88def80396a8","resolution":{"observed_at":"2026-08-06T13:48:53.428642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20263","last_updated":"2025-07-27T13:14:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T13:48:46.645639Z","submitted_at":"2025-07-27T13:14:48Z","title":"Learning from Expert Factors: Trajectory-level Reward Shaping for Formulaic Alpha Mining"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2507.20263."}