{"as_of":"2026-08-07T11:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5377c528e6ad98d3d28b3309741d4c1b356c0bb30437f6cfcb05c9b51d76769","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:55:58.828795Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.18383/citation-record","integrity":"/paper/2510.18383/integrity","json":"/paper/2510.18383/citation-record.json","paper":"/paper/2510.18383"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.526698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.526698Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:f3ff0cf41238ca3c61c0d6abfb41a852ff5fe0bb7fb38e16ad4cabd544d9cb7d","observation_id":"d1c81681-92eb-4117-89a7-bbedacdd9a62","resolution":{"observed_at":"2026-08-04T08:55:58.526698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.535363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.535363Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e515b11b1bdc342677d184e545c994b7056fdc25fb4a5d87e2b0d9bbc0005642","observation_id":"7693d82b-32ce-43c2-bdd1-894d3401f9c5","resolution":{"observed_at":"2026-08-04T08:55:58.535363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.541079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.541079Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:73fb8e5a2f58179739cb4ee18dcdc5b37a7bc6c5be03081a41b73b5c7706f421","observation_id":"f9ba5fdc-0707-4b53-8eb9-388a0ed72549","resolution":{"observed_at":"2026-08-04T08:55:58.541079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-07-06T20:58:19.305457Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-04T08:55:58.545648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.545648Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9c02b66ec2d03ea264b440cb5f783dae69839eb7de55c4382ca7bdb63f1c7b8b","observation_id":"ae9ad3e8-a359-403d-b06a-4234b279a55d","resolution":{"observed_at":"2026-08-04T08:55:58.545648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-07-06T21:28:24.644692Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T08:55:58.550417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.550417Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d64b8338ce3c3671622dde79bdfa81cfe3c2f7f8b45fd1ee9bf06df0447d02f6","observation_id":"3a280a8b-e968-43f2-8ec5-90bbbe690e94","resolution":{"observed_at":"2026-08-04T08:55:58.550417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.91","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"e66db5dc-6a9a-4e39-9bab-55bf9de38fe9","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.555012Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:479e55f5f818c1213ca3368038ea949d8394ea7f840e3a7b63a146e81de2a053","observation_id":"51ff5311-ae2a-4a5d-93d0-66f498b69373","resolution":{"observed_at":"2026-08-04T08:58:31.607089Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-04T01:53:44.205351Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-04T08:55:58.560564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.560564Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:70a44c9752a733c9aa899a1c33f560d7ca95dddc82b3b63af2fa88c4d771a96c","observation_id":"e62b3e33-6608-4856-aca4-e8b3cb3ed20e","resolution":{"observed_at":"2026-08-04T08:55:58.560564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19842","last_updated":"2024-05-30T08:49:34Z","snapshot_observed_at":"2026-07-06T18:22:31.384923Z","submitted_at":"2024-05-30T08:49:34Z","title":"Improve Student's Reasoning Generalizability through Cascading Decomposed CoTs Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19842","snapshot_observed_at":"2026-08-04T08:55:58.565705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.565705Z"},"links":{"cited_paper":"/paper/2405.19842","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:78d932f151deb65c294b98b1d9128864655387da645c1c9d7e5200f64b1206ec","observation_id":"b9a364c0-71d5-4bcd-bd89-994a3db68594","resolution":{"observed_at":"2026-08-04T08:55:58.565705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.571387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.571387Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:084044ccd049703f7fde9ab1dfb23c5baf3860f0fc43052549e396b7058a98be","observation_id":"ab00aba2-ed70-4162-8aa2-bed354f01d86","resolution":{"observed_at":"2026-08-04T08:55:58.571387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T08:55:58.576083Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.576083Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:3c54081e6c6679c81dad2309de4710fda981a8d25e74fe0f8741c78f348c2d02","observation_id":"78c4557a-f11c-4df4-84fd-6f0b44aa6948","resolution":{"observed_at":"2026-08-04T08:55:58.576083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T08:55:58.581084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.581084Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:6d4868212177fd8808ef4f0777ae8c5d112b90627b59c190183de76e7d50ac9b","observation_id":"06dfca44-1c00-4d8c-8ece-9b7bb9ab5c00","resolution":{"observed_at":"2026-08-04T08:55:58.581084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.586028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.586028Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:0f6ad3b1ee93b98a54ba0b945fd977fa20239f93cdda8421c6bfbbf76eed99e9","observation_id":"6d0f405e-d7cb-4edf-9bda-94929f10d04a","resolution":{"observed_at":"2026-08-04T08:55:58.586028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.590626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.590626Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:72c141aa8e9102a82c6f1d15d6b49fb03723ddb07f3f9a075a59b5a6c1866df8","observation_id":"c5f29713-be10-40ec-a81b-63df1a9ee705","resolution":{"observed_at":"2026-08-04T08:55:58.590626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.594790Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.594790Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:a8b0d281ce3cb7fe6feaf13eec18ad40b739ae2558532ddc9517887778ae15d1","observation_id":"88eff210-0dae-457f-a4df-1ba9d3f35292","resolution":{"observed_at":"2026-08-04T08:55:58.594790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.599443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.599443Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e9a33cf68c14f4e5f148468e98b13fdb21807f2385a73ebccc277ccaf7e7ec0d","observation_id":"1a1e5459-173e-4b5e-98d4-bdb91eaab672","resolution":{"observed_at":"2026-08-04T08:55:58.599443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.603979Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.603979Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d2a7b8e8d3cf99ab95c249c9c6490dfd941d37039a7d033fe82ca79978d7d21e","observation_id":"4f65d7d8-ec82-40b2-bc18-165f4449cfb3","resolution":{"observed_at":"2026-08-04T08:55:58.603979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T08:55:58.608828Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.608828Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:bd27092b47ab0d830353b7a8eab6a42e52185521e43b616a7e608158e36fb30a","observation_id":"66f28734-ff82-493c-9852-ada0b102d42f","resolution":{"observed_at":"2026-08-04T08:55:58.608828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T08:55:58.613740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.613740Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e7d1359b45dbee8dc17cc313507528bc6a2b5cbc34dd1a41da45c3a63fa1cdf4","observation_id":"91a79947-b1bb-4788-9a65-e5b761eee3d8","resolution":{"observed_at":"2026-08-04T08:55:58.613740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.61","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"8399d671-88a0-42d2-ab08-67cce5db5efd","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.618333Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:45cb2bd38574d6861a6d8e22293c355c07cfc9853829e553a032b9649d11dd3b","observation_id":"bfb5ef7f-c2b7-41a1-939f-4bee2fcc24c9","resolution":{"observed_at":"2026-08-04T08:58:31.475304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.622595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.622595Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:568026ad2344d058d9a0c3fa0dcb4a7a564146fcdb2b1d7ed56a1b0d913d69fe","observation_id":"86b95219-44b1-4b5e-a4a1-f06aa1cd01aa","resolution":{"observed_at":"2026-08-04T08:55:58.622595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.627305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.627305Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:2adf9d074792a06e3826d1120bb0229457e58f6cf786a66329a30f3b1cc7e302","observation_id":"e12a4255-856c-46ad-9ef7-aa1dfb951425","resolution":{"observed_at":"2026-08-04T08:55:58.627305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.631650Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.631650Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e1c8431a96f370fe1cc43ec3a7c1926c4fc6026f38e23a4bbfcca4f67954ebb7","observation_id":"a10d9621-0cec-4a0c-b02f-7fef2fd5fa9e","resolution":{"observed_at":"2026-08-04T08:55:58.631650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.636359Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.636359Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ec98f329bd5fca8fb506f137f9849e65acac0bae8a9347c961332128849a4a3a","observation_id":"13e726e7-bd7e-4547-b60a-e73d5bc20a16","resolution":{"observed_at":"2026-08-04T08:55:58.636359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.640766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.640766Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ac47f4082bff3e2a255b1df9d1aa0338c148bb1a2667be7b590c559a4d933b96","observation_id":"885a75a0-e6f2-4742-a896-1cbe0fb7836a","resolution":{"observed_at":"2026-08-04T08:55:58.640766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.645518Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.645518Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:500e8c8e8f421033ce5779bd40ce84934dd69066c88f849721942ce526564346","observation_id":"bd25fe70-e380-489c-bccd-b94365c42041","resolution":{"observed_at":"2026-08-04T08:55:58.645518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11315","last_updated":"2023-11-19T12:37:30Z","snapshot_observed_at":"2026-08-02T07:14:55.153336Z","submitted_at":"2023-11-19T12:37:30Z","title":"TPTU-v2: Boosting Task Planning and Tool Usage of Large Language Model-based Agents in Real-world Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11315","snapshot_observed_at":"2026-08-04T08:55:58.649949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.649949Z"},"links":{"cited_paper":"/paper/2311.11315","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:c4e9547d2979f7073f216ada48be06e830927b91edb31a601fb07a2085f8f518","observation_id":"df2e4a58-1d23-4121-9910-792e8d416aca","resolution":{"observed_at":"2026-08-04T08:55:58.649949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-04T08:55:58.655096Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.655096Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:4f50224943ebafbca4e81149131b24676f15b010be88655cc8a2e8412a25fb97","observation_id":"35273487-6d54-4493-aa0e-a10989e94339","resolution":{"observed_at":"2026-08-04T08:55:58.655096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-07-06T20:34:39.536540Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-04T08:55:58.659542Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.659542Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:bd8da5c258d25fd9cfeebd0aada73726abaa0932fc1527228c37fff9bd00f1a7","observation_id":"0887370a-54b9-4fdf-a4ac-577d9376f2f7","resolution":{"observed_at":"2026-08-04T08:55:58.659542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.663870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.663870Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:5d165e9369b0cb0012bab09870ad423779a5e2e67dfda2ff9fd826822ce58b18","observation_id":"cec7624a-c365-482a-b2d1-4d29979e5543","resolution":{"observed_at":"2026-08-04T08:55:58.663870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.668140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.668140Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:e240eab4dee7a67c051b5b9349b2b5735988505e95b46c9e37d23984c7740747","observation_id":"cded21b1-dc0f-4f9d-811c-f2f35c3dd36d","resolution":{"observed_at":"2026-08-04T08:55:58.668140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.672391Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.672391Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:076da4f42d5def30b121bd5708bf0abce6536e2739007a3e3529bb62ab1fbdd6","observation_id":"5dafb6d8-5432-44d3-a103-d84ee6682cf7","resolution":{"observed_at":"2026-08-04T08:55:58.672391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05867","last_updated":"2025-02-09T12:06:10Z","snapshot_observed_at":"2026-07-06T20:33:29.458482Z","submitted_at":"2025-02-09T12:06:10Z","title":"Self-Training Large Language Models for Tool-Use Without Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05867","snapshot_observed_at":"2026-08-04T08:55:58.676999Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.676999Z"},"links":{"cited_paper":"/paper/2502.05867","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9b5bfc919712b5a8681b5295ea152c2f8f651ccf6f063a7ea51c3dd2504d5cdc","observation_id":"fabb6a06-c309-4768-ad9b-bd27b5184468","resolution":{"observed_at":"2026-08-04T08:55:58.676999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-05T11:19:48.609021Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.14257","snapshot_observed_at":"2026-08-04T08:55:58.681765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.681765Z"},"links":{"cited_paper":"/paper/2509.14257","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:22f1142b6f6d3775f9fbf482f6a89b1e51fb0d8be9990b140011e9296b5fd177","observation_id":"ffdab585-71ee-4ecd-a1da-ae45c1f93a2f","resolution":{"observed_at":"2026-08-04T08:55:58.681765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09014","last_updated":"2023-03-16T01:04:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T01:04:45Z","title":"ART: Automatic multi-step reasoning and tool-use for large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09014","snapshot_observed_at":"2026-08-04T08:55:58.686891Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.686891Z"},"links":{"cited_paper":"/paper/2303.09014","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:db52a0e53b4badf1c86916d2c2f0d81f9241f6b5462d70915f51ee4bd037b33f","observation_id":"201fa9f0-6e2f-4453-8b47-2cc69a32b1e2","resolution":{"observed_at":"2026-08-04T08:55:58.686891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.691802Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.691802Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d1389333b0e2a4ad007dbb88078d08bb974e2b144e2127fe343add243cb87931","observation_id":"fd611c45-4fb8-49cd-94ff-9913ed299b3d","resolution":{"observed_at":"2026-08-04T08:55:58.691802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.695844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.695844Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d20e6054d3906968800490c7f1a6fb58bd9bff82c54d554a56a05566005299f0","observation_id":"98bcafa2-19ea-44fe-a9b1-9445f531367f","resolution":{"observed_at":"2026-08-04T08:55:58.695844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-04T08:55:58.700248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.700248Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:276969ac93b82124664b886893a35168d81b45d2b7499af1d2c9daae15d7db13","observation_id":"f777e1f4-deb6-4a1b-ac92-a9911390a276","resolution":{"observed_at":"2026-08-04T08:55:58.700248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.48","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"6f290791-faaf-459e-9c2f-90f3feab468f","year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.704653Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8a67a315283ff58924e15c1b1c97b466c4d07fb9be44a243a989b28c77317976","observation_id":"85297bdb-f9cc-4c35-9eba-cd589a144fe9","resolution":{"observed_at":"2026-08-04T08:58:31.328348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14728","last_updated":"2025-06-17T17:08:32Z","snapshot_observed_at":"2026-08-07T00:07:52.996609Z","submitted_at":"2025-06-17T17:08:32Z","title":"AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14728","snapshot_observed_at":"2026-08-04T08:55:58.708980Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.708980Z"},"links":{"cited_paper":"/paper/2506.14728","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:be35410044601b674efe24e356ff8596f2e029b8ad23f042df84e8af5644c218","observation_id":"b9cdfc19-79fd-438b-b499-37108b44385d","resolution":{"observed_at":"2026-08-04T08:55:58.708980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T08:55:58.714056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.714056Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:bb15f3f1079898ccac72766569fdc4b04eedc432987938cc7b6dbef5d1e6b0c8","observation_id":"089cc73e-f85b-4b94-bf57-132b84e3bfa3","resolution":{"observed_at":"2026-08-04T08:55:58.714056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.718525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.718525Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:bcbda9678569246bede6c387957fae52dd632fd6942d5d8e4feb1926173ba39a","observation_id":"47449036-6866-4c3c-a19f-36b622fcfe69","resolution":{"observed_at":"2026-08-04T08:55:58.718525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:55:58.723046Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.723046Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:52b7a6d5964606e6e703be25e2c71f47bf4bc7d4f128482bcf30106a4db5408c","observation_id":"e2ef7d70-0e40-4f26-9116-a9c59a73133d","resolution":{"observed_at":"2026-08-04T08:55:58.723046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T08:55:58.727453Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.727453Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:04293443cd2ac6a723c81a7d04cba4410f8f407205840da87745091c3582e6ab","observation_id":"75cd815c-e27d-4a06-aaf1-a220052d98e1","resolution":{"observed_at":"2026-08-04T08:55:58.727453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T08:55:58.731703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.731703Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b82f6578838ff9b4b63463c6f20a6076d927d730d8159371ab0445fe3e87ac1e","observation_id":"5a5a4ddc-a842-4a66-a217-915d49281ec4","resolution":{"observed_at":"2026-08-04T08:55:58.731703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-04T08:55:58.736344Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.736344Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:5a802c125aeaa5c07717a90c428b25a806520607befb1e881485bee2a458f2dd","observation_id":"1322423a-7eab-4316-aea0-00406cad06da","resolution":{"observed_at":"2026-08-04T08:55:58.736344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.742622Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.742622Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8deef854d6b3ef00b9378a08a3fbdee26d00c272afb405971f39fe48286f09e5","observation_id":"dddb4053-77f6-4175-a9d6-ddfc9c3e9225","resolution":{"observed_at":"2026-08-04T08:55:58.742622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.748285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.748285Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:f1df0d274505e81818c74f201f9d1b6e3d9780905c602e88bd5ced69ff9a4913","observation_id":"6c975a41-de88-4417-bf60-f0799217a7b2","resolution":{"observed_at":"2026-08-04T08:55:58.748285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.753379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.753379Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9872f19b28e28d6aecafbb84f627bf6b2f9c5d8c375798a5caed95227ec37345","observation_id":"396fc1c9-0ffc-4426-ba37-44953ac2cd76","resolution":{"observed_at":"2026-08-04T08:55:58.753379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.759048Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.759048Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8da8b193068a02f715b55df14579a02bd7f1ba164eb592577643b3312c5f9e75","observation_id":"f0b8dce6-0f88-4b52-9bdf-ea5a78b62e7e","resolution":{"observed_at":"2026-08-04T08:55:58.759048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-04T08:55:58.764014Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.764014Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:95204a50815344e147eb172a14f745ee8a8c094c31efdeedd296397c66c683f1","observation_id":"0b3542fc-b4e1-4aac-9db5-679251a413c3","resolution":{"observed_at":"2026-08-04T08:55:58.764014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.769104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.769104Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1ada79dd9d05bf9ab4639dc90931975abab059ab008fbe70f42954b2c6d2ea2a","observation_id":"a7766cf9-99d0-4e62-9840-c8c132c5ee7d","resolution":{"observed_at":"2026-08-04T08:55:58.769104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-06T22:44:10.264269Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T08:55:58.773353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.773353Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:1b9001e6d2d323ff699fb355f6e79e1947900e599cddb2917c75ad3bf82cecbd","observation_id":"67b20b37-35a5-48b2-8b64-50cd07d52306","resolution":{"observed_at":"2026-08-04T08:55:58.773353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-04T08:55:58.778667Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.778667Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:eeeb0526f7c3ba21ca3b27a1f38e128f5cd3583ac45764538cb14368764726c9","observation_id":"17c3d065-b494-448f-80f4-4c536249bf21","resolution":{"observed_at":"2026-08-04T08:55:58.778667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.783361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.783361Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:d9cbcb5906fc3f6542ebf105408b269ef173787fbde1243b19212602217e5b01","observation_id":"841bf8cc-6af8-4b60-8016-70f2a88d3ed2","resolution":{"observed_at":"2026-08-04T08:55:58.783361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.787754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.787754Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:b3ebba1dbfce18fd0fb27a2f7106210b1acaf84be81dccfc0afa9a1336dcf17d","observation_id":"328dc584-3583-4338-abc1-416eebd8a8e6","resolution":{"observed_at":"2026-08-04T08:55:58.787754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-01T17:35:58.677762Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-08-04T08:55:58.792516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.792516Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:cbcd000bdbbd347028040cf850c97d49516adb0803f56b962110f7fca2ce58bb","observation_id":"e141f2e5-c99d-43d4-acb4-8e21cc1a7426","resolution":{"observed_at":"2026-08-04T08:55:58.792516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-04T08:55:58.797104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.797104Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:2ae73924ed721853e6cccd80ee051ebf72cfc144823d90dc0e51e993fff1adca","observation_id":"b751338d-3cd5-4acd-bc02-e6e0f32cdaea","resolution":{"observed_at":"2026-08-04T08:55:58.797104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.801782Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.801782Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:fc84ba15a0826c07934ca3411cb0634fa74bdd87f84ef162d07343a730f3f000","observation_id":"9c90dc37-7a59-47ed-8c5d-92c2af116d4e","resolution":{"observed_at":"2026-08-04T08:55:58.801782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.806320Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.806320Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:7e54da984716e4ef6c69f80350a43306aaca2655e36c2181b94b41a4fe3d0edb","observation_id":"938722f6-172b-4831-a5cb-e2a032a2be7e","resolution":{"observed_at":"2026-08-04T08:55:58.806320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09804","last_updated":"2025-01-16T19:23:11Z","snapshot_observed_at":"2026-08-06T11:51:00.192063Z","submitted_at":"2025-01-16T19:23:11Z","title":"Enhancing Generalization in Chain of Thought Reasoning for Smaller Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09804","snapshot_observed_at":"2026-08-04T08:55:58.810427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.810427Z"},"links":{"cited_paper":"/paper/2501.09804","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:8d8ae8dfa0c4cc57da6fb6d9f71944de6bb65dd73f875591f1de57c46066b8d0","observation_id":"8482faed-1636-4af1-af6b-96c5074befa2","resolution":{"observed_at":"2026-08-04T08:55:58.810427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07745","last_updated":"2025-08-17T06:06:35Z","snapshot_observed_at":"2026-08-05T02:48:38.796743Z","submitted_at":"2024-10-10T09:23:26Z","title":"StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07745","snapshot_observed_at":"2026-08-04T08:55:58.814994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.814994Z"},"links":{"cited_paper":"/paper/2410.07745","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:9fa7bf63fee79548c8ea14a2f0831a2da2edf5cb59ee7ea540100b0ce7c6ce53","observation_id":"8f878ced-d3f7-4122-9056-02d59d5cf58d","resolution":{"observed_at":"2026-08-04T08:55:58.814994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07921","last_updated":"2023-08-15T17:58:45Z","snapshot_observed_at":"2026-08-05T10:01:24.612975Z","submitted_at":"2023-08-15T17:58:45Z","title":"Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07921","snapshot_observed_at":"2026-08-04T08:55:58.819366Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.819366Z"},"links":{"cited_paper":"/paper/2308.07921","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:6745494b099fdd91f4740b6c41fb51b2ac4fb1f243f7aa2dd20c11dcd29f5f42","observation_id":"4fc9fc3a-9ae6-4abc-bdbe-ebe7479750bb","resolution":{"observed_at":"2026-08-04T08:55:58.819366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.823939Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.823939Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:a557a5f8f6ef025bb8765ddb92b1d4aa5c4b0b0360b6031e65cf27038f8393f6","observation_id":"f2b889f0-a615-4ec7-bbee-c4037a817e9f","resolution":{"observed_at":"2026-08-04T08:55:58.823939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:55:58.828795Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.828795Z"},"links":{"citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:6bdd579d06379111291adc2fd60b30a034b8f0efad4c5956a8de160d86c0457a","observation_id":"84aa8d46-0ee5-40d7-8d82-4d16aa04f921","resolution":{"observed_at":"2026-08-04T08:55:58.828795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:36:35.328841Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2510.18383."}