{"as_of":"2026-08-07T18:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed3262ae77bb37d7e053dc343eb3c21a75be0d44797c6587e664197e970a41ef","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:45:04.656219Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00054/citation-record","integrity":"/paper/2507.00054/integrity","json":"/paper/2507.00054/citation-record.json","paper":"/paper/2507.00054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.893528Z","title":", Aneja, J","venue":null,"work_id":"367e694a-d630-4027-ab9f-e53edec44fcd","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.832083Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:3ca506469bd0980483f79d289dc591fa0e0ac3333fb22ecffec6799828fd6de9","observation_id":"f9f7112a-3f5c-4430-89ce-ec48996e0545","resolution":{"observed_at":"2026-08-06T22:45:11.959401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.627147Z","title":", Vieillard, N","venue":null,"work_id":"40e8a69f-556d-4f97-bc6b-e5bfacfe71c9","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.887421Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:15e82326b043ec537d7ac4c098fa58441dd60d7631438affab15a3f315ed17d9","observation_id":"5334a726-edd3-4b45-a7fd-d1a4b28a4136","resolution":{"observed_at":"2026-08-06T22:45:11.756821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.363463Z","title":", Vieillard, N","venue":null,"work_id":"5f858bd5-5a02-4e5d-b512-5b01d6dc4f33","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:44:59.969850Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:fd3209964caa910c4a5c2ea7da9d1b9ef43378da695d6391a25466fb672cdc7f","observation_id":"7976eb97-c850-406e-8b1a-15efc9efb035","resolution":{"observed_at":"2026-08-06T22:45:11.433341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03730","last_updated":"2025-03-25T00:07:50Z","snapshot_observed_at":"2026-08-07T17:26:50.379012Z","submitted_at":"2025-03-05T18:40:19Z","title":"Towards Understanding Distilled Reasoning Models: A Representational Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03730","snapshot_observed_at":"2026-08-06T22:45:00.068336Z","title":"\\ Tegmark, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.068336Z"},"links":{"cited_paper":"/paper/2503.03730","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:1a2b94a5938edb5d1965f505a167c7f40f17f712dbac110fbe2a8f38eca46812","observation_id":"963a99e5-8b87-4347-bc6c-33ec5f7679fa","resolution":{"observed_at":"2026-08-06T22:45:00.068336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:11.110997Z","title":", Sastre, I","venue":null,"work_id":"d07dac7c-b5a9-4c34-9f9d-401cda981bf9","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.163772Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:58f66dd80d076743b2dbae082f748a09423f2425ceeba879c7916b54436793b0","observation_id":"9813e50b-31b0-44d5-a629-a293fc9c17f5","resolution":{"observed_at":"2026-08-06T22:45:11.259853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16737","last_updated":"2024-10-07T19:37:10Z","snapshot_observed_at":"2026-08-05T14:38:11.927737Z","submitted_at":"2024-08-29T17:32:35Z","title":"Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16737","snapshot_observed_at":"2026-08-06T22:45:00.253407Z","title":", Hosseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.253407Z"},"links":{"cited_paper":"/paper/2408.16737","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:10934d0949996e8611b9593414ae251ce89898634f5285afe04d2e0471e22150","observation_id":"ee832064-5677-498b-93ca-96c24d0a7770","resolution":{"observed_at":"2026-08-06T22:45:00.253407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.945346Z","title":", Peebles, B","venue":null,"work_id":"0597f818-fa3a-4d56-b369-372de2b8b262","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.323553Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:acb64aa9fff5b1a6982c8cf55fb89a19a8957a77b4a95a30ff523353c193aa23","observation_id":"7ca5a211-4a5a-4bd4-8f10-23e74975e1db","resolution":{"observed_at":"2026-08-06T22:45:11.016657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:45:00.383119Z","title":", Kosaraju, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.383119Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:0f963ad8822e26d1cbc96422e1e73c610b084615043ce841d67e82ccbaeb90ee","observation_id":"8585932b-95fd-4e64-8168-4765ac6904cd","resolution":{"observed_at":"2026-08-06T22:45:00.383119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.798123Z","title":"\\ Ngo, C","venue":null,"work_id":"5c110a3f-3cbe-4f89-bd7d-36f05cf1b2ca","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.432702Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:492f4df04c4977464a0b86872a34bfd669ad994dff55e9df6820f683ecd3ba63","observation_id":"ae03c8ce-0b48-4fad-9d78-2c9f0baa78ed","resolution":{"observed_at":"2026-08-06T22:45:10.872019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.594692Z","title":", See, A","venue":null,"work_id":"c62eb27c-48d9-4261-bb47-598ee305439a","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.499454Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:290fa6f3e9d90dc24734465f64ae2f16193df602ba11c5d0156276db64f7c2e8","observation_id":"b0065cb9-5d07-4763-8d75-6ddc406cc9e4","resolution":{"observed_at":"2026-08-06T22:45:10.714160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.443889Z","title":", Feng, B","venue":null,"work_id":"343fdcbb-58b5-4e87-828e-5dbc745c143e","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.562770Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:9ee88148f16e9b01820fa05d1211f549d30d5898685edbe05b0f008efae3ad91","observation_id":"fda81fd6-744d-48b2-a6d0-d940a7757342","resolution":{"observed_at":"2026-08-06T22:45:10.515033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.282148Z","title":null,"venue":null,"work_id":"234650e2-fef8-42cc-9e14-9594491c87b3","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.644914Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:28a2cb6c727bcaec38f42490496647480a78cd44c5469ef22a26adf1a770ea73","observation_id":"88c34840-15c4-4128-afbb-d71d4410be5d","resolution":{"observed_at":"2026-08-06T22:45:10.354570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:10.013477Z","title":null,"venue":null,"work_id":"b9796061-b525-4894-ba1e-490e7857bb93","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.717936Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:bf57b0058340f466f5c293f24a8abaf46b7f183322af4b7528679ac8b96d203a","observation_id":"8a236ce7-78d9-45d5-9e9a-3c7e6eb7b7cd","resolution":{"observed_at":"2026-08-06T22:45:10.118810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17927","last_updated":"2025-03-05T05:46:28Z","snapshot_observed_at":"2026-08-07T17:50:59.432318Z","submitted_at":"2025-02-25T07:47:22Z","title":"Advantage-Guided Distillation for Preference Alignment in Small Language Models","version":2},"cited_work":{"arxiv_id":"2502.17927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17927","snapshot_observed_at":"2026-08-06T22:45:05.582957Z","title":"Advantage-Guided Distillation for Preference Alignment in Small Language Models","venue":"cs.CL","work_id":"5e1a78ef-e6de-4a93-9f4f-d4fe6373c871","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.774715Z"},"links":{"cited_paper":"/paper/2502.17927","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2e47403858dfddb9c5cb59ba43a926db0dd1ff7b49582ac6f492bc3898672f2a","observation_id":"8af77e78-1dab-42c3-bf88-2b07b2c7012b","resolution":{"observed_at":"2026-08-06T22:45:05.664522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-06T22:45:00.840611Z","title":", Dong, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.840611Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:67f282d663404dbfa92c065978e3176eaacf93f9943b09594532fb809795402e","observation_id":"ba453a7e-76aa-4268-970c-cc687a2a4b18","resolution":{"observed_at":"2026-08-06T22:45:00.840611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.785380Z","title":", Zhang, L L","venue":null,"work_id":"5a066683-1e18-4efc-be5e-2981b2ed52ac","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.916470Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:9d14dd04d64d674d0578b51e410cb435c85d0139c153c9c712487ba2912474e5","observation_id":"ec3ea647-c2f7-4d1b-bdb7-e7e74b0b621e","resolution":{"observed_at":"2026-08-06T22:45:09.899083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:45:00.969331Z","title":", Yang, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:00.969331Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:70f194743530221567c97104c897a53b7fc6b6c1833f58dd3d26129e22934fbb","observation_id":"3a330c4d-5b4f-4e1d-91db-ba0f3d6215db","resolution":{"observed_at":"2026-08-06T22:45:00.969331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.581809Z","title":", Vinyals, O","venue":null,"work_id":"c54a853d-6c4b-4999-b157-14cb63753b45","year":2015},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.034051Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:86886b99011b1334cf098264b5f1fbeda9f6dcb97f1944570f9a656043a32ceb","observation_id":"2cc95be0-a373-4d5d-89c2-100f15211594","resolution":{"observed_at":"2026-08-06T22:45:09.681927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.372847Z","title":", Borgeaud, S","venue":null,"work_id":"138ba949-741e-48c2-9764-2799d18e00a6","year":2022},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.104215Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:854bc70ee5a51c5f3a6db8e42c7f1debc06c62e3b06ce619516d287891ec7949","observation_id":"2988ec95-7570-4805-86fe-20b740f166c6","resolution":{"observed_at":"2026-08-06T22:45:09.484507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:09.150998Z","title":", Li, C L","venue":null,"work_id":"a3046377-e2d5-4b56-9f24-b79b5a84cc0b","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.208161Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d0ad5525980dc8313d73ad321e3f0a6df0b9a23af1d1cacf6c125de8cb9ff7c8","observation_id":"38769f70-6b26-4119-a44c-9bc87c2dcc74","resolution":{"observed_at":"2026-08-06T22:45:09.258428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.939740Z","title":", Yin, Y","venue":null,"work_id":"f28ae1aa-e8b4-4463-ab93-1311ad2540ff","year":2020},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.282141Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:d9d804bed2682127db944b48cc5478f26223c94d65ad0bd5ea91a8807c36dfb6","observation_id":"b2223c7a-1689-484d-a335-981e059a7d3c","resolution":{"observed_at":"2026-08-06T22:45:09.049575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16265","last_updated":"2024-06-26T14:01:15Z","snapshot_observed_at":"2026-08-01T16:15:24.164308Z","submitted_at":"2024-05-25T15:07:33Z","title":"MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16265","snapshot_observed_at":"2026-08-06T22:45:01.362923Z","title":", Li, X Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.362923Z"},"links":{"cited_paper":"/paper/2405.16265","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b1d6887c35bbff9d35ebe76b7090e03f63155ffada84355b561feb9c77580ebe","observation_id":"c63aaa27-aeda-4fdf-b195-07a0ea7ca4b8","resolution":{"observed_at":"2026-08-06T22:45:01.362923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.736649Z","title":"\\ Rush, A M","venue":null,"work_id":"a8bcdb34-a68b-448e-970f-c15c6c51423f","year":2016},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.446884Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e5e95cf9d4447fb08300aef03d41885fc2be4dfb2f30a53294db04af8fbcdf2b","observation_id":"ba9ae507-d70d-49b0-9c49-f1052c19a884","resolution":{"observed_at":"2026-08-06T22:45:08.841836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07067","last_updated":"2025-05-30T04:41:12Z","snapshot_observed_at":"2026-08-07T17:17:34.718676Z","submitted_at":"2025-03-10T08:51:32Z","title":"DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07067","snapshot_observed_at":"2026-08-06T22:45:01.511764Z","title":", Chen, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.511764Z"},"links":{"cited_paper":"/paper/2503.07067","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a71bf4afe461e678d304dd68ebe1e1865333c41c32f8fca52035bd7b60790a52","observation_id":"d76b30f7-97b5-49f2-8da9-86c67609c337","resolution":{"observed_at":"2026-08-06T22:45:01.511764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-05T01:48:55.895470Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-06T22:45:01.602702Z","title":", Kim, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.602702Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:4a0ecc3c561178599ff89d929c5998f88affcc22046821820c2bcee862278ea8","observation_id":"bf1372cb-2c2d-4815-b264-30df58d36e6d","resolution":{"observed_at":"2026-08-06T22:45:01.602702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.552416Z","title":", Fang, L","venue":null,"work_id":"b037061a-8752-49c2-9a08-c8f7f323b9d1","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.662995Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:84c916befb7af23fd010c1bc823e907579641b3a5104529ac1ad16028e02efa1","observation_id":"bbfeb791-a91d-4c43-9cde-01ea480d017f","resolution":{"observed_at":"2026-08-06T22:45:08.621314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19545","last_updated":"2025-07-21T15:24:26Z","snapshot_observed_at":"2026-08-07T17:44:57.505841Z","submitted_at":"2025-02-26T20:34:58Z","title":"Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19545","snapshot_observed_at":"2026-08-06T22:45:01.734181Z","title":", White, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.734181Z"},"links":{"cited_paper":"/paper/2502.19545","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:f1f20016d8ed08d8350a027b923b99ed16f05029444122cd28083c57fa7dbd22","observation_id":"1f40c54b-8e47-4293-9125-d763d5183b0d","resolution":{"observed_at":"2026-08-06T22:45:01.734181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19255","last_updated":"2024-07-02T03:46:03Z","snapshot_observed_at":"2026-08-06T12:10:50.595602Z","submitted_at":"2024-02-29T15:26:14Z","title":"GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19255","snapshot_observed_at":"2026-08-06T22:45:01.803122Z","title":", Cui, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.803122Z"},"links":{"cited_paper":"/paper/2402.19255","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:218c0aea0a4e47e8f95ee2e1ffce93fd5c278fb97225e13ff7288702e677185a","observation_id":"1f1635b6-be41-4bcb-aa4b-a089978da199","resolution":{"observed_at":"2026-08-06T22:45:01.803122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06414","last_updated":"2024-03-11T03:55:24Z","snapshot_observed_at":"2026-08-01T08:52:21.834652Z","submitted_at":"2024-03-11T03:55:24Z","title":"Evolving Knowledge Distillation with Large Language Models and Active Learning","version":1},"cited_work":{"arxiv_id":"2403.06414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06414","snapshot_observed_at":"2026-08-06T22:45:05.336125Z","title":"Evolving Knowledge Distillation with Large Language Models and Active Learning","venue":"cs.CL","work_id":"15763e85-a4fd-4839-ac0e-ac2dccd9f69a","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.899416Z"},"links":{"cited_paper":"/paper/2403.06414","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:bdf6529bcd3c48d5cf2868991405d5b2e848b359c881acbbb16a54774b095630","observation_id":"a41021f4-9434-410f-86af-7fde9090a21d","resolution":{"observed_at":"2026-08-06T22:45:05.399923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.479552Z","title":", Chen, C","venue":null,"work_id":"a5ff8f40-210e-4a4d-bfc3-995d03086c7d","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:01.987456Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:eba917af02486ae964d43b1b6e54e33969278df89de25a8743d7e0d31c1de972","observation_id":"c9427546-55e8-4e8e-81c2-4f74cca695e4","resolution":{"observed_at":"2026-08-06T22:45:08.535787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.292134Z","title":", Yang, Z","venue":null,"work_id":"8b513eba-1904-4bc1-af6d-84006a11a776","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.050079Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2131ae610a56145f4d467caf6e83bb35208ec3199c077c7a1bae3bcdc06ded4b","observation_id":"663344f9-7e30-47e0-89bc-9ac38933d316","resolution":{"observed_at":"2026-08-06T22:45:08.365808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:08.105231Z","title":", Dani, J","venue":null,"work_id":"d8847474-6ae0-4282-b844-26fc37758e8c","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.176949Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:76225f09b7542ba9d193d9a9169a38082a2238c488daaa28b6ade6c72a2b8757","observation_id":"335802d2-6c7b-402c-8a4f-1c2f5861e9a2","resolution":{"observed_at":"2026-08-06T22:45:08.178769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.889811Z","title":null,"venue":null,"work_id":"e1b132db-603d-4ae6-8ced-8344ea413c83","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.296854Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e930d863d20ec17110dc115257deeadfba586e5442acce50620afa52fd01f4ae","observation_id":"f6df0b60-2933-495f-86bb-c081bc56fa71","resolution":{"observed_at":"2026-08-06T22:45:08.012500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.688216Z","title":", Lerer, A","venue":null,"work_id":"5ecb3887-4763-4f77-99f9-b34eb28b7ba4","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.381998Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a6bb3d5b301a41f0128f1827ae149e5f2ccbb4f74ccdbba2eaeefea6c5690e23","observation_id":"71d9bb01-9f8b-4ccc-a41a-b8716ccb4285","resolution":{"observed_at":"2026-08-06T22:45:07.780048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05464","last_updated":"2024-10-07T19:49:24Z","snapshot_observed_at":"2026-07-06T19:29:18.770662Z","submitted_at":"2024-10-07T19:49:24Z","title":"Progressive distillation induces an implicit curriculum","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05464","snapshot_observed_at":"2026-08-06T22:45:02.463708Z","title":", Liu, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.463708Z"},"links":{"cited_paper":"/paper/2410.05464","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a82506a9e5fddc2420f8a687b606e3d90348e7e19a3ed3a51ef67b7c87c5dc13","observation_id":"710f5486-52fa-4b6d-8121-0e832a6133de","resolution":{"observed_at":"2026-08-06T22:45:02.463708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.479800Z","title":", Kim, D","venue":null,"work_id":"fe5ddbb3-bc9e-4a73-80b8-c277a6d426ea","year":2019},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.552158Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:70d8c780f34170861412d5a5d8d1b30d9b24fe0728fcd52c68fb8f8df45a9225","observation_id":"0d86e769-ece0-4b0e-8736-d57c1f90975d","resolution":{"observed_at":"2026-08-06T22:45:07.585952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.279975Z","title":"\\ Xie, S","venue":null,"work_id":"6a85706a-ea49-47a3-be30-9fa0e18d822d","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.621187Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a63ebfe8413395b4eb0fb5ce4684230274db20633554d30e6297262914af8b03","observation_id":"17d3ac87-dd4d-41a7-bd6d-017ad7752bd1","resolution":{"observed_at":"2026-08-06T22:45:07.347692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04781","last_updated":"2024-05-08T03:11:12Z","snapshot_observed_at":"2026-07-06T18:11:21.771258Z","submitted_at":"2024-05-08T03:11:12Z","title":"CourseGPT-zh: an Educational Large Language Model Based on Knowledge Distillation Incorporating Prompt Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04781","snapshot_observed_at":"2026-08-06T22:45:02.697368Z","title":", Yin, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.697368Z"},"links":{"cited_paper":"/paper/2405.04781","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:e9c19bc7b5e497e1ede0aa37b9d37bb7c0d0847870c6a212e165b9172b04e62d","observation_id":"dedb6313-b2d1-43cd-89cb-46c0ddf3e22b","resolution":{"observed_at":"2026-08-06T22:45:02.697368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-06T22:45:02.785656Z","title":", Debut, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.785656Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:95cd473b9840286e0c19df8bfb9f84d6096d22594451d6064fbf973dfee62de4","observation_id":"ab12e167-1817-48ba-a32c-9941bc621f32","resolution":{"observed_at":"2026-08-06T22:45:02.785656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:45:02.881915Z","title":", Li, S S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.881915Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a92196c8ce02768d8874449f0cf929e4dc88bf1af4166c01f4c97e354cf5ba19","observation_id":"870979c2-4e34-441d-8bad-e60b4bcbc6c5","resolution":{"observed_at":"2026-08-06T22:45:02.881915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.143918Z","title":", Wang, P","venue":null,"work_id":"7fff8f9b-be77-4525-a482-2757a14545e6","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.953539Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:17889e4560045b7283c3577140abba34e69c2e8d8522cebc1ada0b7f498f822d","observation_id":"f2c60319-8fc3-427f-901d-8f0079bc5860","resolution":{"observed_at":"2026-08-06T22:45:07.207353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T22:45:03.029566Z","title":", Shumaylov, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.029566Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b31e3bf39ce61c3063274aa0579b5d52bb3a73cb95c6ca51f13b74a1c80dbe9c","observation_id":"98e0f490-a8be-44cd-9845-3e4ee7a4db71","resolution":{"observed_at":"2026-08-06T22:45:03.029566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T22:45:03.122039Z","title":", Kamath, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.122039Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:beb1cc818f97fa1eb44c85806990010d2fa34b800e22aae9e55310dfe9adeb31","observation_id":"13b7323d-6a46-4c54-9d5e-0eae71e6578a","resolution":{"observed_at":"2026-08-06T22:45:03.122039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:07.052835Z","title":", Riviere, M","venue":null,"work_id":"a57d15ae-b7d6-4e8b-a3e9-5e24b8ad8914","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.183890Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2bf18ac70f5bcde1f5505353c4bf56114acc74aafcb90f12065ebaf814a3f834","observation_id":"48454789-9132-4ff1-9fe3-3a143de98d2c","resolution":{"observed_at":"2026-08-06T22:45:07.097328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.922541Z","title":", Han, Y","venue":null,"work_id":"9add0411-587b-47bc-971f-aa52da7e12ab","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.261446Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a160846284cb035a213846c4e159e19317d5e6e97ae6ed2babad3481483fe4c8","observation_id":"e8406170-4e51-474e-9ba0-a26b4c29b939","resolution":{"observed_at":"2026-08-06T22:45:06.972873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02671","last_updated":"2025-02-04T19:26:28Z","snapshot_observed_at":"2026-08-05T07:55:26.264059Z","submitted_at":"2025-02-04T19:26:28Z","title":"On Teacher Hacking in Language Model Distillation","version":1},"cited_work":{"arxiv_id":"2502.02671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02671","snapshot_observed_at":"2026-08-06T22:45:05.037045Z","title":"On Teacher Hacking in Language Model Distillation","venue":"cs.LG","work_id":"3344ea39-4300-4d9b-b255-277c8360ac47","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.331296Z"},"links":{"cited_paper":"/paper/2502.02671","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:a48a445bd9fd8665b8b3d9b424a7193964892be196418f16157d8f0d4af5e72f","observation_id":"8a34b152-2464-440c-a5d0-9a7c4e36895b","resolution":{"observed_at":"2026-08-06T22:45:05.113351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06659","last_updated":"2025-05-20T13:38:24Z","snapshot_observed_at":"2026-07-06T20:34:06.899427Z","submitted_at":"2025-02-10T16:48:56Z","title":"Who Taught You That? Tracing Teachers in Model Distillation","version":3},"cited_work":{"arxiv_id":"2502.06659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06659","snapshot_observed_at":"2026-08-06T22:45:04.869692Z","title":"Who Taught You That? Tracing Teachers in Model Distillation","venue":"cs.CL","work_id":"c47a8e36-2074-4a7d-95b8-4fe7319dc1cb","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.441504Z"},"links":{"cited_paper":"/paper/2502.06659","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:2176b4ddbe77f4751243bb1c5f6cfe26342b3274a997bb649bf614af4c95ffbf","observation_id":"210ff84e-986d-4660-8fd8-a7be4c99448c","resolution":{"observed_at":"2026-08-06T22:45:04.943544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.795962Z","title":", Deng, Y","venue":null,"work_id":"75589b5f-b1d4-4102-b19c-68dd851f7801","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.513056Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:0829c9bbd21ad4c28505f03b054abfd47fd887bcd795e86be0e28f26f5ab51d1","observation_id":"42e753af-4bd2-485d-819e-d73112561ade","resolution":{"observed_at":"2026-08-06T22:45:06.848770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-04T03:34:32.259687Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-06T22:45:03.646532Z","title":", Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.646532Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:09027f31e48f7982dc867d24aa3862a532772b7514530608e77708980953a5f7","observation_id":"5fc159c6-a4f4-462a-8797-6b4e79b3f834","resolution":{"observed_at":"2026-08-06T22:45:03.646532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.681211Z","title":", Zhu, J Y","venue":null,"work_id":"f9f217c8-478a-4b38-9b77-4cc2391acf69","year":2020},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.749143Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:70fe562f14290d1ef6eddcfc6d20e1893b7159676adf3567722b609a9d758b8c","observation_id":"41d95ac2-3c60-4166-a078-0a33e91b1192","resolution":{"observed_at":"2026-08-06T22:45:06.722937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.545138Z","title":null,"venue":null,"work_id":"fd837107-665f-402f-9e7c-a85f7c19ea26","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.850600Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:77104324e121a94978ae8e35d8beb74347ac1bbcdd4fddcf0c090e93468127a9","observation_id":"ba61adf8-9c15-4502-b0db-7ff5881e1db4","resolution":{"observed_at":"2026-08-06T22:45:06.608963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.439438Z","title":", Wang, X","venue":null,"work_id":"b42a92f9-d760-4456-8352-3db7aec7e9d9","year":2022},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.920673Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:5dd1cb57f6e73144899825914d3906dcefb27b171db0005eca589a453a0f5e96","observation_id":"d3fcc0b3-7961-4740-aadb-991067663937","resolution":{"observed_at":"2026-08-06T22:45:06.488819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.329702Z","title":", Bai, H","venue":null,"work_id":"b23ee8e9-db71-4926-834d-ca6364ad13c9","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:03.977383Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:6e1599132bf038a885eba00d0a97cc8bcb398b1d6c4c74bc1870e46f9a56a77d","observation_id":"8eafc91f-9730-40aa-b099-dbda10b62673","resolution":{"observed_at":"2026-08-06T22:45:06.376947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11325","last_updated":"2025-04-27T23:18:29Z","snapshot_observed_at":"2026-07-06T19:33:39.134036Z","submitted_at":"2024-10-15T06:51:25Z","title":"Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11325","snapshot_observed_at":"2026-08-06T22:45:04.144603Z","title":", Han, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.144603Z"},"links":{"cited_paper":"/paper/2410.11325","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:eba31324aa4fb2c0ca86c250f095c54d4e01a2209c02595d3ec3a2b31b28e63d","observation_id":"6290ed46-791e-4ba6-aeac-df36eb0ac94b","resolution":{"observed_at":"2026-08-06T22:45:04.144603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:45:04.222611Z","title":", Yang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.222611Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:24f21ff2a56db7433787e472154800d79a68e805ed2d1f9e2b55666c2346834b","observation_id":"c9a0cc89-1f21-4f07-be33-6c3063688a6b","resolution":{"observed_at":"2026-08-06T22:45:04.222611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T22:45:04.300085Z","title":", Tong, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.300085Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:5735c85e3701dd3f337e5ab4765b68a162f1a9068d0749f4533645d816f6e13d","observation_id":"5f3339e7-b708-4899-86bf-8386abf8fd21","resolution":{"observed_at":"2026-08-06T22:45:04.300085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.209968Z","title":", Wang, C","venue":null,"work_id":"58e5dba6-e66a-4d80-a620-ff631c5825bd","year":2024},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.408916Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:5e8fb0fae7cb3d147bf6f1981b6d7f5577bfbb39cfd0f3ae0978afcf8558b7ab","observation_id":"012f0bf2-3f3d-406b-b1c2-e8c678c75d5e","resolution":{"observed_at":"2026-08-06T22:45:06.275447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:06.082193Z","title":", Zhu, R","venue":null,"work_id":"c21e7737-d15c-4487-9071-600846396ac6","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.485680Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:43b437a633a46494f2ec5ff8319c54869a03f22b304c626f275ba783cd0cd0da","observation_id":"c1d9a273-3749-4648-b408-bc667bbe660f","resolution":{"observed_at":"2026-08-06T22:45:06.151692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:05.975068Z","title":", Zhu, R","venue":null,"work_id":"27d9d037-fe03-466e-b339-cc422cae964a","year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.548728Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:1bc8b18c11982cf56e11ea79ab8bfc5e312229554a15933ab3636970ebe335fc","observation_id":"d6cefc1b-c2e3-4129-a043-5a2f8a170d5d","resolution":{"observed_at":"2026-08-06T22:45:06.021904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:45:05.818092Z","title":", Shen, J","venue":null,"work_id":"3e1ef030-ac96-4370-8ede-261e668abe21","year":2023},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.612738Z"},"links":{"citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:5180f7e809439ea90f045d0ad4942f929c2507e68ae6ad438b74377a1251ea27","observation_id":"5b25e6b2-6caf-47bb-b638-48ef19505fc7","resolution":{"observed_at":"2026-08-06T22:45:05.904741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-08-07T17:44:55.814616Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-08-06T22:45:04.656219Z","title":", Wang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:04.656219Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b77f9798e5bbc084d07a2f96dc5fcc31d2849d9d2d8d883fc74972c0c6ea32ec","observation_id":"5dae83d3-89e7-4d02-807a-4b57195fbd38","resolution":{"observed_at":"2026-08-06T22:45:04.656219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T16:14:51.532240Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2507.00054."}