{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf848108ebbef7814cfa2be250429fc292146c970518ffd5d09695a9a79013ef","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:49.447695Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18952/citation-record","integrity":"/paper/2505.18952/integrity","json":"/paper/2505.18952/citation-record.json","paper":"/paper/2505.18952"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.172936Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.172936Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ccd71d16a80da12e4d3ca8cc171ae95f6753530890e07685ec0fd67d741e267b","observation_id":"59addfc3-77f6-42dc-9b13-99b28a498885","resolution":{"observed_at":"2026-08-07T14:27:49.172936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.179006Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.179006Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:7acb5416a06ddd6a45c225ae50aca4ac5abb3861ba888e71f9fa8f2b7df15e03","observation_id":"b69b458e-c723-4647-bb7d-58d1371ed75a","resolution":{"observed_at":"2026-08-07T14:27:49.179006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.184236Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.184236Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5536f7abdbe1f03050c980c6f631e0fe6d4efcdf2820e1ef932281c258acc130","observation_id":"66c8fd9c-96b9-4e6a-9be4-f58ce783a0ba","resolution":{"observed_at":"2026-08-07T14:27:49.184236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T14:27:49.189344Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.189344Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:db2f8674043f375e66999c86ee06a9dc2a32ad47ddbfa3395b269cb4af2366d6","observation_id":"6d333c0d-b3e6-439f-b780-8e2532147483","resolution":{"observed_at":"2026-08-07T14:27:49.189344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.135615Z","title":"Claude 3 family","venue":null,"work_id":"02ee70e4-513e-4925-b47d-38b4cb93b9e3","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.193617Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:68b4ae92f12a3f512f5b338c02e67c09c27b765129e256be9169a4f1539ce4dc","observation_id":"2282d970-697f-4073-aa62-40c41c0c9510","resolution":{"observed_at":"2026-08-07T14:27:50.139409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.122773Z","title":"Gpt-4 is openai’s most advanced system, producing safer and more useful responses, 2024","venue":null,"work_id":"3a08d398-a15e-4224-82bf-ccbe5585fe96","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.208501Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:c7a7bddd6962e4badd86997e3497ae8041b53bdf727d2d8c3c70e7a33f4112ae","observation_id":"d52f406c-99ba-418d-b2c5-263817954980","resolution":{"observed_at":"2026-08-07T14:27:50.127285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-07T14:27:49.213678Z","title":"Value-incentivized preference optimization: A unified approach to online and offline rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.213678Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:0434825eb0927a22b4f6990edcfa829db38952aebd87e67eca4e9d605621e3fe","observation_id":"710f5ccd-f9e6-472b-989a-e103c6851d94","resolution":{"observed_at":"2026-08-07T14:27:49.213678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.108849Z","title":"Knowledge distillation of black-box large language models, 2024","venue":null,"work_id":"9bfa0a74-ccbf-48d4-b575-21ce0dc0ee5d","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.219066Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b16d63c9e9ede529523c3bcd744077ec4ab85a4dde0df27ad2eb859b7d6aeb66","observation_id":"e953fc06-285d-4d15-baab-417c2c7dc0e6","resolution":{"observed_at":"2026-08-07T14:27:50.113522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.095320Z","title":"Information-theoretic considerations in batch reinforcement learning","venue":null,"work_id":"79648a70-424c-45cf-9785-41143de173b3","year":2019},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.223575Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:371e703de9184b3d5f115d9d4fe242c6bb343423b38bc8bae43fd9514482c3ab","observation_id":"72cfc732-41d6-4d40-8a45-21290303f112","resolution":{"observed_at":"2026-08-07T14:27:50.100612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.082496Z","title":"Distilling knowledge learned in bert for text generation","venue":null,"work_id":"ed7cbdfe-91f5-433d-a556-d8b58e8236b1","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.227911Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6f5447549026a67f48986e4612d5671f71502214b5347271f06150a1f9c40773","observation_id":"00ef125b-bfbd-47d0-a74b-e3139451a397","resolution":{"observed_at":"2026-08-07T14:27:50.087106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.232858Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.232858Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:53e87424ccf87da7ac2591e9e125d26fac48b733456b2949384e65b91b7bd9e9","observation_id":"4208ee3d-3827-491b-b60f-b8609a9c7a79","resolution":{"observed_at":"2026-08-07T14:27:49.232858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.236919Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.236919Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ddbceb5d34f9ef49967b68d21784a78d9d0fd2d160230d542d4fa184ad580857","observation_id":"34ae95c8-2171-4fa9-8927-572d0ea0e9d7","resolution":{"observed_at":"2026-08-07T14:27:49.236919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:27:49.240934Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.240934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:f6446ba31af4be72027cbb278352e48e57e34fb130aca8c00dcc8ea1f2f63ebf","observation_id":"ca2004ef-5cdb-4b16-8c46-a47a8af4582d","resolution":{"observed_at":"2026-08-07T14:27:49.240934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:27:49.244981Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.244981Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:37400e5e117eaebcb87374f613a05da33c60bebc8a3306b4d681d61dcbbd4325","observation_id":"98b21e71-a03c-41e5-af1b-ba32a9930d78","resolution":{"observed_at":"2026-08-07T14:27:49.244981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.249279Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.249279Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:bc0f9bc66e594f0061a68050e5bbe097d518f16bfcf36dfc73534d8af8a2a358","observation_id":"fdbadbfd-da79-4e23-a822-dc15546d48e4","resolution":{"observed_at":"2026-08-07T14:27:49.249279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.048653Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":"179f41e6-f71d-42d9-a9fc-d306156ad6b3","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.253183Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:36c976922ee7c8dae915552bcd01854b4e5fbe87faf299560f93d7673e387c91","observation_id":"f3317dc0-9d1d-4283-97f0-72bd436f7dcc","resolution":{"observed_at":"2026-08-07T14:27:50.052465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.035560Z","title":"Stochastic linear optimization under bandit feedback","venue":null,"work_id":"d80b69d7-fb12-4b9a-bf7d-81ed0ed70514","year":2008},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.257789Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:007f504828c7d26e17514e783348d39c55e9846af1409510f1f19df24edfe00e","observation_id":"4d41c677-2518-404b-a14c-a747c279317b","resolution":{"observed_at":"2026-08-07T14:27:50.040022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:50.024516Z","title":"Openllama: An open reproduction of llama","venue":null,"work_id":"8cdaae04-767b-4410-93bf-a1fcb589506a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.262377Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5b6d02a6925ea05272f3ce18c419fd632e45f2e8ac832afa5df694d9aa431911","observation_id":"ce12f250-4f44-48c1-ad61-7200fb8b2439","resolution":{"observed_at":"2026-08-07T14:27:50.028443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.266807Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.266807Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d14918ec139787c8913fc3c0ababf53a25891bc07824340418911ef942a3c6aa","observation_id":"ad3fb493-2ba3-4271-a22d-85192fab2dc5","resolution":{"observed_at":"2026-08-07T14:27:49.266807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:27:49.270567Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.270567Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:4606f56a18b6aaf5826feb04e362df489293c8949272127c2748f308091a44ff","observation_id":"49e448cb-6a11-4e17-ae8d-5ecd6eb7f0f3","resolution":{"observed_at":"2026-08-07T14:27:49.270567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.275247Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.275247Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:1a540020cf2fb4827895cc9c5190f5916a1afecd3ba77a2d7b365635b74dd78f","observation_id":"3afeb083-cbd3-4ad9-8b15-2882493f894d","resolution":{"observed_at":"2026-08-07T14:27:49.275247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:27:49.279060Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.279060Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6a065403e20060ee92b7f4b35acb8c64b3e9150e7cf05c6eb863b37e2a63ef05","observation_id":"afd52b7c-3055-4d4d-84ab-0bea56822713","resolution":{"observed_at":"2026-08-07T14:27:49.279060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.995307Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor","venue":null,"work_id":"f52549ef-15ac-4cb6-bd59-f5b1b13fa1f0","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.283639Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b8c3012cbfd3234da572b040b985bb1f67fcc5f02445ab4128efe5e745472158","observation_id":"04deee70-79ff-4e23-b213-0866dca0cf22","resolution":{"observed_at":"2026-08-07T14:27:50.001512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.978814Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"ad7502d2-a5b4-4bb4-9e26-1c90bc5b5815","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.287480Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:8492d0c79160bfa40ba7f48d2ea5c4380b263dd8c9495e9bffc5dd749c58422c","observation_id":"095018b2-f406-4c49-a671-cd95e0e668e3","resolution":{"observed_at":"2026-08-07T14:27:49.983865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.958704Z","title":"Adversarial moment-matching distillation of large language models","venue":null,"work_id":"68879bf3-5ba2-472c-872d-67e4e03a0fb0","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.295167Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3939728bec25b230c01256c2e2a8821cfd3dd7ffc7b964864e380f73d9b77629","observation_id":"ddd20eab-7613-46db-b578-35c42979b48d","resolution":{"observed_at":"2026-08-07T14:27:49.962918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.291106Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.291106Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b2dd08c63fbcc50b0af1ab45988d10e22e30bb7fa9550a0250081b0482c1518a","observation_id":"9d3ce41b-3151-416d-944b-76ebfa0b15a2","resolution":{"observed_at":"2026-08-07T14:27:49.291106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.931364Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":"428d52a8-a0c9-4715-b79c-9b4531fca871","year":2016},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.303395Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:4b6378f1681e09dfd13119ef45fb75ba4e01ac8fd52db9eadc52945e5a6efbea","observation_id":"b7de2377-19f5-4805-8bd6-fb1023fece96","resolution":{"observed_at":"2026-08-07T14:27:49.935337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.944137Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":"e04e8532-0d7b-45e0-9c5d-254f7cefd2c5","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.299174Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:2966917c84f868d4e95f51baf73462dc2b4f0c16a70ce1b49ef8178d2e4a2ff9","observation_id":"f367807d-13ac-45ef-b61b-4af49f4a7255","resolution":{"observed_at":"2026-08-07T14:27:49.948970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-07T14:27:49.311523Z","title":"Direct preference knowledge distillation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.311523Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:0ed52010d562f483566228071b405f156360440351dd3f3cbb2a529886f8be23","observation_id":"5fbb818f-063b-466e-85ef-e368a5800469","resolution":{"observed_at":"2026-08-07T14:27:49.311523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.919327Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"e3c6608c-33ee-44da-96b5-fe94f0ade347","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.307693Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:57d776c56bb13f7caa74028a8362ad699c24a13a484a08e45ae26e5b1121bfba","observation_id":"28d439b1-116d-4074-9e5d-17e9966d8356","resolution":{"observed_at":"2026-08-07T14:27:49.923252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.895759Z","title":"Autoregressive knowledge distillation through imitation learning","venue":null,"work_id":"2993159c-bdcb-4f77-9f83-fe9f0878c86a","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.319541Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:79111140d874034f50727c9615081412def07ca6e1df620de0409bd5c7dd155a","observation_id":"59d05b33-e740-40c0-bf04-d1503d336845","resolution":{"observed_at":"2026-08-07T14:27:49.899697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.907187Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"30b17b0c-68e1-4cba-bfc1-6a7a90588b3e","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.315912Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:026075596f35756ecf66eba653cc413a21eda5af76549fde3f920a0479de3bc8","observation_id":"a062182a-381a-4113-a7ca-2b9a8f9fb9fa","resolution":{"observed_at":"2026-08-07T14:27:49.911217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09241","last_updated":"2023-12-14T18:58:28Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T18:58:28Z","title":"TinyGSM: achieving >80% on GSM8k with small language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09241","snapshot_observed_at":"2026-08-07T14:27:49.328172Z","title":"TinyGSM: Achieving >80% on GSM8K with Small Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.328172Z"},"links":{"cited_paper":"/paper/2312.09241","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:22e38d5a992eb519fe2bc494a354f8bfcbe8a23340b55891f0a347d0a96b7bdd","observation_id":"2a94db03-1fd9-44d4-b52f-aaccfd86e1d6","resolution":{"observed_at":"2026-08-07T14:27:49.328172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.882135Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"07f16364-4928-4ce5-b6f2-30c5d9f26f94","year":2004},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.324021Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ce8c9ec13aadf2cd457b2c950f8b85de740d0158ad80b4ab7e920b4586f525a9","observation_id":"0b1527a5-863c-4975-9caf-eb50e87ce8ad","resolution":{"observed_at":"2026-08-07T14:27:49.887728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.335177Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.335177Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:888333494e7819db426041b998e3e43a9fedc94a9acf7d058b0484c99b49039f","observation_id":"d77b095e-aa7a-44bf-bc36-b8993ea832d3","resolution":{"observed_at":"2026-08-07T14:27:49.335177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T14:27:49.331916Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.331916Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3aa638adc1cdf9a879ace427eddd62c549f387bda8a9157ebba95025d23f7bb9","observation_id":"c400cc17-38ff-4af9-9e18-eb952fb59898","resolution":{"observed_at":"2026-08-07T14:27:49.331916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.862006Z","title":"Linearly parameterized bandits","venue":null,"work_id":"cfb40de2-4ea0-479c-84f7-d1e6f97254c4","year":2010},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.343111Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:89eb0e418313872a608e93ff2aebba60e8f250e5f4e0d4cd6a4d61ec45acf1d6","observation_id":"b82c11d5-5432-4c83-9329-afdfa5b23c4e","resolution":{"observed_at":"2026-08-07T14:27:49.866336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-07T14:27:49.338434Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.338434Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:d232cf50c8ddaa406f0274472649b073185554a8e2396f5e974beb80ec1ca3a2","observation_id":"d098173b-6f47-467a-becf-6decefae2354","resolution":{"observed_at":"2026-08-07T14:27:49.338434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.848706Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":"fe29878b-d5a6-4c48-86bf-b43af08c4898","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.351084Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b51d80ae258a9b4e8cc6ad6419073bb8e3b2001348134895dea4d9c062e42ccd","observation_id":"55a182ff-d4d1-48db-b5c8-ccd0febaee66","resolution":{"observed_at":"2026-08-07T14:27:49.852660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:27:49.346880Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.346880Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6de646d756b58cb98c60fbaa21117723e3a6930bae603ded55b174ac1c08dba1","observation_id":"cf70783c-9ce3-47e1-a898-1a34128b8653","resolution":{"observed_at":"2026-08-07T14:27:49.346880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.823751Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":"d551fc60-0c6a-4d05-bae0-fd4760144e09","year":2019},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.361088Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:974b816c1f354e2929bd8efb489ff87657865a7829c30864c683a5ffb45d20d5","observation_id":"6f562761-1290-4e74-8baf-5206bf01bc0a","resolution":{"observed_at":"2026-08-07T14:27:49.827919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.835350Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"7a38fd93-3206-4f6a-9571-ade300826a71","year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.356124Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:4038cc779441d1a64d520de6520e6cb4a08f02cd42e3900bc03743dcdd21f3f3","observation_id":"9f0d88d0-0d9f-4a1c-8562-0d5b05c465e6","resolution":{"observed_at":"2026-08-07T14:27:49.840182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.799437Z","title":"Of moments and match- ing: A game-theoretic framework for closing the imitation gap","venue":null,"work_id":"28f15c3e-a07f-40fc-9e1a-4f7dd730da5c","year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.369280Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3d86f3888a1e01638dbe471e0dff27ade7e2060fc9c5d0cd04cad762c487bd21","observation_id":"8bf6598a-24a4-4fb3-a270-8dd9a7bb1ea4","resolution":{"observed_at":"2026-08-07T14:27:49.803933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.811928Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"3ac0bfa8-2a12-46c8-8bf1-6873b8206259","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.365451Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:02d81b5a92d32e04fe899b52a0a1f568a91f53164847d1b32953ec3345ac6611","observation_id":"56170899-96d4-424b-831d-609f23fc7305","resolution":{"observed_at":"2026-08-07T14:27:49.816354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:27:49.379150Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.379150Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:722ae448d77c5c2c6e80456fe4fbb030bec9ca0e4004bb1066133fc06d67a759","observation_id":"e2523298-82ef-452f-aff5-ac7a8ab597cb","resolution":{"observed_at":"2026-08-07T14:27:49.379150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.374653Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.374653Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:95535a882082bb5a4433f867efc7eb0b49646c036617830b5a5f961b97755e1f","observation_id":"79e79d0a-3303-4470-a879-5698d3738d7c","resolution":{"observed_at":"2026-08-07T14:27:49.374653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.387131Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.387131Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:e8443b8b973dd9a3242b2cc03c6b4a21ad186b8815ed9ce953f07112e990dc19","observation_id":"bbe4ff12-43fe-4232-bcd4-e15dd3add8bc","resolution":{"observed_at":"2026-08-07T14:27:49.387131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.778747Z","title":"Selective knowledge distillation for neural machine translation","venue":null,"work_id":"57b62431-2af8-45dc-a2ed-598c45bc09d7","year":2021},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.382987Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:ab71d0a3de0add84677e9ce025a2f26c56545e6d6a89a05f6652d7ddcaa2abe1","observation_id":"30b4d144-9a8c-4fbf-88ff-0a0d427ae1d2","resolution":{"observed_at":"2026-08-07T14:27:49.783300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.747751Z","title":"Self-instruct: Aligning language models with self-generated in- structions","venue":null,"work_id":"b827d9ae-1602-4a83-96a6-73124aff41e4","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.395277Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:faa664d474bbd6ada1375082c8fbbd06636bffabf3cb2ea772317e58c32b3731","observation_id":"7f0a7e71-d80b-4079-9c28-82e5807ba4a4","resolution":{"observed_at":"2026-08-07T14:27:49.751385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.759252Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"a1e00715-c13a-4c63-b1f0-c16c0acf1d5a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.391263Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:9fc662a47cd1b6af4a2642efbfeb5505a80dd8c0d4ca3ca64ce726af89673380","observation_id":"ea241061-40c4-49a8-be59-4fa3a0749da7","resolution":{"observed_at":"2026-08-07T14:27:49.764237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.721628Z","title":"f-divergence minimization for sequence-level knowledge distillation","venue":null,"work_id":"a8105c85-a9b4-4f9f-ab86-e1ee35eb194a","year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.403615Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:04388615eab8a784e4f48851c3401dfd66a484878a17c9640a87daeacb6a2324","observation_id":"a7fd4a4a-8696-4e12-878d-91962d7ac8ec","resolution":{"observed_at":"2026-08-07T14:27:49.726555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.735428Z","title":"Super-naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks","venue":null,"work_id":"087cacb5-3055-429d-bd48-e5aa7d600f0a","year":2022},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.399435Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:4bbe1f81769aa8c7d5c83a34789445fbdb4af2f1e67b73cf380971f93f3dfb8b","observation_id":"9193a10d-b238-4dfa-b57a-18285898ac5b","resolution":{"observed_at":"2026-08-07T14:27:49.739753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:27:49.412002Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.412002Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:5f418a5add02ac6d0f3d48deee7a4732554cbcafe079c6a49c1146226de12ecb","observation_id":"31f262d2-7e67-4908-bc9b-f3c41959ec52","resolution":{"observed_at":"2026-08-07T14:27:49.412002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.408130Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.408130Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:8d80cf5314c22af449a7b92a7696f1d1e37084f209117ae57950fdbf9b8375db","observation_id":"76c67b11-d524-4152-8e7a-03e5b443adc0","resolution":{"observed_at":"2026-08-07T14:27:49.408130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.690163Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":"1c6a3140-e2ec-4bfe-b928-c6c6de820432","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.420593Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:159bb9cf6ec79e7fdd560965a20b61486be38810a5532d4b10fad8fbbc36dd93","observation_id":"c770c7b2-3bab-4173-b871-f675889b37eb","resolution":{"observed_at":"2026-08-07T14:27:49.694198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.701961Z","title":"Online iterative reinforcement learning from human feedback with general preference model","venue":null,"work_id":"57259eae-3ed1-4aea-9d42-1795b31503c9","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.415999Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:6311dc0994d50ff987f8ed992eeba5b0a4726b62c646f6258c25f4d97fc94c10","observation_id":"72392bfe-04c8-4e01-94bd-8013d2fedae8","resolution":{"observed_at":"2026-08-07T14:27:49.707419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.677882Z","title":"Plad: Preference-based large language model distillation with pseudo-preference pairs","venue":null,"work_id":"fc6beb09-97a2-4654-9922-22153f42ed5e","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.428701Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:3a1f5f26da99a922b976936ce1628b7fb9b4e3da17606c54250d9ba493993505","observation_id":"10a3c533-330a-43cd-8bf4-351f10f6a8fd","resolution":{"observed_at":"2026-08-07T14:27:49.682195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T14:27:49.424641Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.424641Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:371f077b84bc6eaf1bb7e9b99a6744c4aaae8ed6a85e0c45cb71af52cf6beead","observation_id":"a52340ce-2c6a-4184-ad7a-2a7213c3799b","resolution":{"observed_at":"2026-08-07T14:27:49.424641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.436721Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.436721Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:371b11e7758c4308e76adacf9e3ac5d3e08b24bd1a4c22fc819c11caf6e28bdb","observation_id":"84784f89-109a-40bb-bd27-586a98d19ecc","resolution":{"observed_at":"2026-08-07T14:27:49.436721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.432511Z","title":"Mathematical analysis of machine learning algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.432511Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:1289c92c79859ca73e09eafee78919243cf563bbe3952183e61283a9a53ba649","observation_id":"3f336086-d72a-4518-ae58-2840ed8c28f1","resolution":{"observed_at":"2026-08-07T14:27:49.432511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.443540Z","title":"Starling-7b: Improving llm helpfulness & harmlessness with rlaif, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.443540Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:b2ef413b4c026a3d2cfd379857805d83756b82e05de59830885aa3a11bca01e8","observation_id":"8e007a6a-5f47-487e-b2f2-221b56409059","resolution":{"observed_at":"2026-08-07T14:27:49.443540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:49.649043Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":"c39e6e8b-7b82-4fbb-9c44-ececc81d51d8","year":2024},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.440054Z"},"links":{"citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:bed8e63a83241499e8705b1a9261f0d1469a8cf742adfc79486395948ef092e4","observation_id":"7d12c72a-b00d-46dc-b77e-05f94e5f29cd","resolution":{"observed_at":"2026-08-07T14:27:49.654744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T14:27:49.447695Z","title":"s Pr(o | x, τ0, τ1) Pr∗ (o | x, τ0, τ1) # ≤ −2 logE x∼d0 ,τ0 ∼π0 |x,τ1 ∼π1 |x o∼Pr∗ (o|x,τ0 ,τ1 )","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.447695Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:cee02f79d9343d6882507070af9d7afc861df5438b87b8ae470b69ed29395e73","observation_id":"1dd11a70-1af2-4288-9ece-00b737f417f7","resolution":{"observed_at":"2026-08-07T14:27:49.447695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00754","last_updated":"2023-12-01T18:07:05Z","snapshot_observed_at":"2026-07-06T16:55:45.402426Z","submitted_at":"2023-12-01T18:07:05Z","title":"Measurements of nematic susceptibility with phase sensitive nuclear magnetic resonance in pulsed strain fields","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00754","snapshot_observed_at":"2026-08-07T14:27:49.203879Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:49.203879Z"},"links":{"cited_paper":"/paper/2312.00754","citing_paper":"/paper/2505.18952"},"observation_digest":"sha256:38b87e4cfe3829f45f63d050d5cc2de2785af59514386847034691a2ebb672d8","observation_id":"ad94eeee-5986-4c0f-956d-b8a04ca31f6f","resolution":{"observed_at":"2026-08-07T14:27:49.203879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18952","last_updated":"2025-05-25T02:56:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:20:33.731542Z","submitted_at":"2025-05-25T02:56:18Z","title":"Online Knowledge Distillation with Reward Guidance"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2505.18952."}