{"as_of":"2026-08-08T23:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40f66f18a130a19c52951d149d31e2b55f8367619646323cee4dff7276753ab9","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:41.962913Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15133/citation-record","integrity":"/paper/2505.15133/integrity","json":"/paper/2505.15133/citation-record.json","paper":"/paper/2505.15133"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T15:27:36.503841Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.503841Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:3169634e3983ea6861db425c1f0692006bd6fac50d4a7cf6d9f17eedf7ff6064","observation_id":"e0d404fe-84a1-4882-bc5f-aa7ea4bf6621","resolution":{"observed_at":"2026-08-07T15:27:36.503841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:46.575560Z","title":"Pkd: General distillation framework for object detectors via pearson correlation coefficient,","venue":null,"work_id":"f10ec435-0533-49f4-9f8c-0ffc529733fe","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.578218Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:db3c07d9783f42b7dd5cadd799ba52faa92e2fd3dc2016a7f5e47c2a9d87b088","observation_id":"64b2b912-3b68-4659-89e3-4725851ac93f","resolution":{"observed_at":"2026-08-07T15:27:46.663089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:46.443290Z","title":"Cross-image relational knowledge distillation for semantic segmentation,","venue":null,"work_id":"35ae8dcd-205e-4e0e-93fa-421d51eb9f28","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.654784Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:50ab751922bf7eefee43411107d9fd95984f479bbfd39c1edc3d2ba9edbff5a8","observation_id":"467201bb-2142-498f-b62a-937a8ad9c233","resolution":{"observed_at":"2026-08-07T15:27:46.492888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:46.303362Z","title":"Relational diffusion distillation for efficient image generation,","venue":null,"work_id":"3acb51c9-5f52-4924-b536-b6a3c81c53de","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.732477Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:e7e741ff9195c8e02ed22a94e050b8ac607c7821facd72675ef49a9da1b18a3d","observation_id":"048105f7-9498-482e-92b3-a565ffb73c11","resolution":{"observed_at":"2026-08-07T15:27:46.383344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:36.856590Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.856590Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:1a1c79e97921484ea8038e2c0ebb6cdaa797a831088ad2b4d202082da468ef75","observation_id":"5092153c-9184-4b2f-8096-1e0113b51c65","resolution":{"observed_at":"2026-08-07T15:27:36.856590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:46.184918Z","title":"Knowledge distillation from single-task teachers to multi-task student for end-to-end au- tonomous driving,","venue":null,"work_id":"8cae5fee-d8ad-4aee-a273-abf6185d9aaa","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:36.954959Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:3d8fd19eba9fba0a0c8f4ff157dc9f01a4346cce5505a06a95f1b49b2d47da75","observation_id":"41b20559-7d8e-479e-a778-ad088e418074","resolution":{"observed_at":"2026-08-07T15:27:46.217421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04619","last_updated":"2024-04-06T12:51:00Z","snapshot_observed_at":"2026-07-06T17:56:32.062035Z","submitted_at":"2024-04-06T12:51:00Z","title":"Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04619","snapshot_observed_at":"2026-08-07T15:27:37.033544Z","title":"Do we really need a complex agent system? distill embodied agent into a single model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.033544Z"},"links":{"cited_paper":"/paper/2404.04619","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:092ba852f1fc4db8108a7d4031167b2e6182317606a7a35b46de1cb818d28013","observation_id":"b5d56058-ea41-4dab-81a0-663b44a4f22f","resolution":{"observed_at":"2026-08-07T15:27:37.033544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01620","last_updated":"2024-06-07T18:13:16Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-02-02T18:35:14Z","title":"MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01620","snapshot_observed_at":"2026-08-07T15:27:37.106377Z","title":"Magdi: Structured distillation of multi-agent interaction graphs improves reasoning in smaller language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.106377Z"},"links":{"cited_paper":"/paper/2402.01620","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:12a294f74b04f88e02c7d72e2f2d694677217acbd26a853124e2f818b4c18d2b","observation_id":"87b6d3ed-9c3b-4d10-ac30-0637744beb7c","resolution":{"observed_at":"2026-08-07T15:27:37.106377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:46.033322Z","title":"Adaptive multi-teacher knowledge distillation with meta-learning,","venue":null,"work_id":"bcae2691-2392-4f8c-a65a-13a156e93b9c","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.182448Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:291f21a3e2e2164f19cb2b38a061814943f8bb77e4c37bc4c6d4a84fb9228390","observation_id":"6166566b-e677-426c-9f83-500f7b089d71","resolution":{"observed_at":"2026-08-07T15:27:46.092176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.966826Z","title":"Multi-teacher knowledge distillation with reinforcement learning for visual recognition,","venue":null,"work_id":"27426c42-7c0b-4e3f-8df8-7b535acd290c","year":2025},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.261794Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:6cb945972a13f40f1bd0d3747d07907a48187c90dff7c3f19f52d0dae78341e4","observation_id":"f1a44d36-16d0-46d4-9421-234512dbad1f","resolution":{"observed_at":"2026-08-07T15:27:45.996742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.810951Z","title":"A comprehensive overhaul of feature distillation,","venue":null,"work_id":"1cc15c0b-4553-46b0-947b-aac9375f3f15","year":2019},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.354357Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:c4694cad87a1dfc1a2d4421a541f6b2dbe1a507f992db776cf2a6ed4169491d9","observation_id":"6608e0ae-61ac-461a-b50f-01971e9db70f","resolution":{"observed_at":"2026-08-07T15:27:45.912751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.659885Z","title":"What makes a","venue":null,"work_id":"046f6c88-1ae8-4ca4-8e27-31ae5b0a7426","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.459039Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:d9b008f3003462418b65d0e361f56cd9c1117b95ef7901a8e33e5a6a12838f65","observation_id":"b792ffef-1906-4fcb-bad1-7f0d4f376713","resolution":{"observed_at":"2026-08-07T15:27:45.733883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.508210Z","title":"Cross-view consistency regularisation for knowledge distillation,","venue":null,"work_id":"cb40ce66-8a01-4c48-8c6b-91cd7665cf00","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.532823Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:eee7580953ccac477ef11ff55718b12411312e7a71def45ec99ffc251ae0ad3a","observation_id":"6399e879-f0b9-4fcb-b5dd-14a752be7a78","resolution":{"observed_at":"2026-08-07T15:27:45.553511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.361748Z","title":"Why logit distillation works: A novel knowledge distillation technique by deriving target augmentation and logits distortion,","venue":null,"work_id":"40ef7b90-390b-4394-a10f-ccb840a7d9f7","year":2025},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.623360Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:d8681ae803cca460c6f4e731a720766e05f693a9c22bcb5da26c7f8ebe32d147","observation_id":"d032f3f7-5560-4133-8105-236682a551ad","resolution":{"observed_at":"2026-08-07T15:27:45.448812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.231667Z","title":"Single teacher, multiple perspectives: Teacher knowledge augmentation for enhanced knowledge distillation,","venue":null,"work_id":"2e563c41-9550-40b4-8c3b-855db1cdefea","year":2025},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.724296Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:64fbe66c42eb4ac6366fd19b2e839b989cf10d8401eb831e13a60ab7ac0a176d","observation_id":"ca360851-f8b1-4ea1-adf6-5a265f7dadd9","resolution":{"observed_at":"2026-08-07T15:27:45.271202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:45.129810Z","title":"Revisiting knowledge distillation via label smoothing regularization,","venue":null,"work_id":"e8bc7cd8-75f6-46a1-ba66-17fb40cf2c0d","year":2020},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.806925Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:2280c1f8450dd366b15c48f2a4f9d7824359955bf6352c9f0e01a2b62319df8e","observation_id":"c0201d6e-27ff-4f44-b48d-3af497d56479","resolution":{"observed_at":"2026-08-07T15:27:45.174276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.970788Z","title":"Debiased distillation for consistency regularization,","venue":null,"work_id":"fa7fa9d0-d4ec-4311-bfc4-439de11700a8","year":2025},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.893043Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:b86c5a1f8ec5bb77015a200512531eb696919765b6533b502acc232e2923ffd0","observation_id":"63ba9aac-2e8f-4535-9ab1-63c20a700ab0","resolution":{"observed_at":"2026-08-07T15:27:45.010488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:37.975545Z","title":"Decoupled knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:37.975545Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:41a03bd2d6496c96b983f0291b79c3366666fc66e7be00a8e46385b68ba6fe5f","observation_id":"ac41c58b-b66a-496b-9ce1-85c355043b37","resolution":{"observed_at":"2026-08-07T15:27:37.975545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.848364Z","title":"Dot: A distillation-oriented trainer,","venue":null,"work_id":"7c132cd8-9158-4460-ab61-6def5515461c","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.097181Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:5d778fee9d73f388928951b33a55f44aae4c74530024060e241049f86d46ec7f","observation_id":"6397544c-5d4c-460d-b1f0-97864a93412a","resolution":{"observed_at":"2026-08-07T15:27:44.924995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.731994Z","title":"Medhi, Stochastic processes","venue":null,"work_id":"db468536-ff5a-4f92-808d-7455ba25ae99","year":1994},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.183381Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:eac69ebafd7a83b782b1c7def1da62ca0dd60ff2df62401c5069ff79515c88c5","observation_id":"88a4b7fa-7ffe-4c10-89c5-3a9e18616648","resolution":{"observed_at":"2026-08-07T15:27:44.770014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07384","last_updated":"2020-02-24T10:47:39Z","snapshot_observed_at":"2026-08-08T09:21:58.309770Z","submitted_at":"2020-01-21T08:33:29Z","title":"Understanding Why Neural Networks Generalize Well Through GSNR of Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07384","snapshot_observed_at":"2026-08-07T15:27:38.291896Z","title":"Understanding why neural networks generalize well through gsnr of parameters,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.291896Z"},"links":{"cited_paper":"/paper/2001.07384","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:79094b9c55961bbba6f2791113d3cd5bb09de0d31993187ef3d4ca178dcc0992","observation_id":"61a9c61d-76fa-4573-b50b-969855e3b1e8","resolution":{"observed_at":"2026-08-07T15:27:38.291896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.603232Z","title":"Towards understanding how momentum improves generalization in deep learning,","venue":null,"work_id":"e8fe6e9a-b37f-44e6-9ace-b5200a32d0a5","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.372172Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:55b612607844fb5d631b34eb23d174d46f34e6e34432812462ed844c23d1de4f","observation_id":"12ca687c-de2b-400b-92d1-d57d5b2d29b7","resolution":{"observed_at":"2026-08-07T15:27:44.684333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.458006Z","title":"Visualizing the loss landscape of neural nets,","venue":null,"work_id":"cf605137-f854-4360-b4fc-2b0199307a9d","year":2018},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.452250Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:defb5c72ec64856de4f077361c4ed355ff78e3bc606fad7f3e3aff35a449aae2","observation_id":"e7d7e849-6faf-432d-8b4b-3ab51de783b8","resolution":{"observed_at":"2026-08-07T15:27:44.516004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.336065Z","title":"Tighter variational bounds are not necessarily better,","venue":null,"work_id":"88e660fd-1386-44c6-b877-9127331d4904","year":2018},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.562746Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:dcf2a9142732215d27e586c09e68365f9ed1308bdaa6ece3628575cc741efad0","observation_id":"04c92e22-e759-4f8e-9f62-40a26f7b97a2","resolution":{"observed_at":"2026-08-07T15:27:44.422216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-07T15:27:38.643965Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.643965Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:000258a5d111a29d85ce7d22e0ed463d44d5c5bfaa20ef4bdfb60717321c788d","observation_id":"6da10cd4-e92a-464c-b70a-efd994502bdc","resolution":{"observed_at":"2026-08-07T15:27:38.643965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-07T15:27:38.742449Z","title":"Averaging weights leads to wider optima and better generalization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.742449Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:5257f736bd34ce1ddf22935704af9d1f8832ba0020da5c0f5e0edb670685ca7e","observation_id":"5afee9b5-69c2-40db-9483-4f2cb568233f","resolution":{"observed_at":"2026-08-07T15:27:38.742449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:38.796907Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.796907Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:308c928b69a627304acab6aee801a9ba921d59e1cae4fbb1da64e25814e76d1e","observation_id":"f5091cf0-be73-4ccf-bcaf-f3443446fc1c","resolution":{"observed_at":"2026-08-07T15:27:38.796907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.216752Z","title":"Curriculum temperature for knowledge distillation,","venue":null,"work_id":"d63bb96a-5185-40dd-a8cc-efb11982d3d9","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:38.919632Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:f83474d85b95c0914c2d71d3a5070f6651c5a62504c90a9e8c6b34901e231c6b","observation_id":"24e1d452-a394-4b57-9a9b-0e5825fd2bba","resolution":{"observed_at":"2026-08-07T15:27:44.251571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:44.089808Z","title":"Improving knowledge distillation via head and tail categories,","venue":null,"work_id":"dcdb80d3-74ca-4522-af9d-ed8f86ae13a2","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.021002Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:f761e643019cc1f71aa20f8b0f6cbd8f0371818d894f8c640cc9d8df1c9a2d1d","observation_id":"c3a8e71d-4001-4eae-9d9b-84fe6d0e6c0f","resolution":{"observed_at":"2026-08-07T15:27:44.147153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-07T15:27:39.103516Z","title":"Fitnets: Hints for thin deep nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.103516Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:b9713424b6dc7ad7de95374e0a25d7da7632dc5c63bc1dd9cf5dec724c250039","observation_id":"81c3a00c-306c-4316-b095-7ac8416df457","resolution":{"observed_at":"2026-08-07T15:27:39.103516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.842349Z","title":"From knowledge distillation to self-knowledge distillation: A unified approach with normalized loss and customized soft labels,","venue":null,"work_id":"53c79195-64c5-4e0b-ab66-27bcd00eeddc","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.485521Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:916d9cc6d2d25109c4b513ab934eae877ad864dd9f69bd5cbc12689df709db04","observation_id":"3a78a949-c106-4b62-815a-c464be8542d5","resolution":{"observed_at":"2026-08-07T15:27:43.913091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07485","last_updated":"2021-01-12T08:46:08Z","snapshot_observed_at":"2026-08-02T18:55:29.830671Z","submitted_at":"2020-10-15T03:03:36Z","title":"Reducing the Teacher-Student Gap via Spherical Knowledge Disitllation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07485","snapshot_observed_at":"2026-08-07T15:27:39.597718Z","title":"Reducing the teacher-student gap via spherical knowledge disitllation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.597718Z"},"links":{"cited_paper":"/paper/2010.07485","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:5b3f80c2be42f2a2d5f7844e1372e0d7d96559958125bd9f96399d097db58405","observation_id":"d62e952e-6251-41cf-878c-757fde8dec17","resolution":{"observed_at":"2026-08-07T15:27:39.597718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.734537Z","title":"Mdr: Multi-stage decoupled relational knowledge distillation with adaptive stage selection,","venue":null,"work_id":"12e6f39d-eae9-46a8-a5cd-d1fb70393ad9","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.716428Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:597b1d913e9f6d8b3446396672fc6d7539c09cb3fcbd2c379294ae5d0a4f3513","observation_id":"67eb321e-2747-41ad-aa17-bfc5e4ce8bb5","resolution":{"observed_at":"2026-08-07T15:27:43.774648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.623421Z","title":"Ntce-kd: Non-target-class-enhanced knowledge distillation,","venue":null,"work_id":"69848abf-e73b-4f3e-b2ab-209bc178c0fb","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.795288Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:b4e11fd1d37e4436871ab68decd9f09c086b58553689dbf4ba2b997ad3287952","observation_id":"d5dc53a5-1c2b-492d-842c-c2f633ac00a7","resolution":{"observed_at":"2026-08-07T15:27:43.669628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.496367Z","title":"Teach less, learn more: On the undistillable classes in knowledge distillation,","venue":null,"work_id":"7e028cb9-a99c-4a70-8320-a41d4e5ccab5","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.874730Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:29e68fec5ae9bda46ee7a58cca89cc14639ee12b734528ff440a62cf01720887","observation_id":"d2f9a4b5-dbe6-4d8c-b83c-5845dfaa0bb4","resolution":{"observed_at":"2026-08-07T15:27:43.554923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07703","last_updated":"2025-07-27T12:26:24Z","snapshot_observed_at":"2026-07-31T17:41:40.615197Z","submitted_at":"2024-08-14T17:59:32Z","title":"Knowledge Distillation with Refined Logits","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07703","snapshot_observed_at":"2026-08-07T15:27:39.980502Z","title":"Knowledge distillation with refined logits,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:39.980502Z"},"links":{"cited_paper":"/paper/2408.07703","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:d8cd29252caf0f946b0e23191c6761678db0eb7af7a6b31659a10d698c5ed45a","observation_id":"3764e83b-aff0-4d4a-9bd1-e7eb7eb6d295","resolution":{"observed_at":"2026-08-07T15:27:39.980502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.403458Z","title":"Domain generalization guided by gradient signal to noise ratio of parameters,","venue":null,"work_id":"5f946bb4-eccf-423c-a0fb-cd2763a572a2","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.074252Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:407e3e02a57b9e501edbcede9674642939d9f0161a07883500182d5b54d2b01a","observation_id":"af30dbb8-8622-40bb-a948-fa405798e00a","resolution":{"observed_at":"2026-08-07T15:27:43.449455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.294154Z","title":"On the importance of initialization and momentum in deep learning,","venue":null,"work_id":"6aab1b3e-fa1e-4993-82e8-f255731404b5","year":2013},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.179286Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:87ef249573b98880e5028ee4dd03b74bd569fb47dc3cfdd9f18d76624020c708","observation_id":"e2ea07f6-45e4-46f9-a864-dd2202ede79e","resolution":{"observed_at":"2026-08-07T15:27:43.332392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:27:40.246422Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.246422Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:fd23de10b502d95e413b52068eb51cea5267d9cb882d2c3e43e026837a0ab8d2","observation_id":"a1ec5fe2-5abf-4729-b67e-2050f1fe33da","resolution":{"observed_at":"2026-08-07T15:27:40.246422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.183547Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":"dd287470-bcf0-4207-a855-5fc593cf4d78","year":2021},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.299744Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:6947403cdcf8a9b6fa379136243ac93029bf898dce5684228db8f25af6e1dd3d","observation_id":"d69f7d98-70f0-4dab-8bc1-e997aa6b81c6","resolution":{"observed_at":"2026-08-07T15:27:43.224578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.075432Z","title":"Logit standardization in knowledge distillation,","venue":null,"work_id":"59795512-fd7f-4749-abcf-30bfef2d9f1c","year":2024},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.439946Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:5e50d3a4986f951c802d6348d64e1ef7fa610635203daac0c08d8f8ee0dff9fd","observation_id":"bf2ac38d-8b05-43ea-8c90-8b6dd8a6a301","resolution":{"observed_at":"2026-08-07T15:27:43.130329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:40.599509Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.599509Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:4178f3fdf6daefd1422d585f865faaaaf08eb9691b633eb4ecb0fa67c083a607","observation_id":"aec4fc97-6318-45a5-a673-7d6192ad26dc","resolution":{"observed_at":"2026-08-07T15:27:40.599509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.972427Z","title":"ImageNet large scale visual recognition challenge,","venue":null,"work_id":"0f561ddc-9b62-4729-919e-4051239efd61","year":2015},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.736777Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:4f28f0bef55f271ca047a73b9401f4dfaff24063d38edd1e4ab0bedeb11ae467","observation_id":"1fdf1eb6-8e30-4f23-b400-e44c51576af0","resolution":{"observed_at":"2026-08-07T15:27:43.016295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.881592Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"68ea5437-d6a3-4016-9bc4-9abbb41245ef","year":2014},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.848369Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:d7d73e4d57602122e1ce73038365e1a4a52a9c55794efacef623b6298d1b64bd","observation_id":"faaeaf93-e5fb-4ba9-a74f-ed0458292694","resolution":{"observed_at":"2026-08-07T15:27:42.929092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.786636Z","title":"Knowledge distillation with the reused teacher classifier,","venue":null,"work_id":"3e28b6fd-d0c0-4edc-bb40-7b0452022102","year":2022},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:40.978509Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:bc605d776560937801a7025b20290b3adc13c2b6e843eee9fd27c91d04b79256","observation_id":"c09611ed-bad6-4b6d-b5a6-d0fedbb3776c","resolution":{"observed_at":"2026-08-07T15:27:42.824884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.725387Z","title":"Class attention transfer based knowledge distillation,","venue":null,"work_id":"30453656-48ae-4fe9-9b01-d914cb7372d8","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.094829Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:4a2e8002ec03e32a154eee8abdb662c88ae6b16d0175232b144036da33841f36","observation_id":"fb03f528-b482-4d0d-a446-a7d10a963463","resolution":{"observed_at":"2026-08-07T15:27:42.756410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.628261Z","title":"Multi-level logit distillation,","venue":null,"work_id":"46782e71-1489-4e34-98e8-2e809e9198e7","year":2023},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.235257Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:13c0f24331f0e2dbcf7059a7ef40797c627f02885558b4e150d1df0a76661cc3","observation_id":"4c520fb1-b70b-4416-b9ca-e4e543f245b9","resolution":{"observed_at":"2026-08-07T15:27:42.673550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:43.969915Z","title":"Distilling knowledge via knowledge review,","venue":null,"work_id":"7c347d34-f038-465a-86eb-c96e3f947093","year":2021},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.348891Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:d696e447d268beda35887accb18e360a648e95f02ed699ff45d78bc8da014570","observation_id":"2cfb5423-4942-4a95-94d2-7cb2966d4faa","resolution":{"observed_at":"2026-08-07T15:27:44.027869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.499954Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":"7ec406e7-88f4-4ce5-b3cb-90dce7101056","year":2015},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.441181Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:90da5da9b33f8226317122b96fd3c0fd8d6db5fb88b356b9a91895ed7f9dcb55","observation_id":"b06a12d0-3a00-44c5-bad6-4897748c8ba2","resolution":{"observed_at":"2026-08-07T15:27:42.559368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.337244Z","title":"Visualizing data using t-sne","venue":null,"work_id":"59564005-c8b6-4871-8c80-60d4c21de659","year":2008},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.607601Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:b9c5329c64c16cb3ee744518ec3d4acd0abcb1098cec23221cfd17ccf588af84","observation_id":"e559f72b-9c14-4c70-8994-fe8a9f1feda7","resolution":{"observed_at":"2026-08-07T15:27:42.423973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03928","last_updated":"2017-02-12T22:05:47Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T21:15:57Z","title":"Paying More Attention to Attention: Improving the Performance of Convolutional Neural Networks via Attention Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03928","snapshot_observed_at":"2026-08-07T15:27:41.661879Z","title":"Paying more attention to attention: Improving the performance of convolutional neural networks via attention transfer,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.661879Z"},"links":{"cited_paper":"/paper/1612.03928","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:a3021985479bca05c275d2827823bd3a6d91c95308c4efd68fe22ce0f1fa7531","observation_id":"d36ba7e0-0db2-47a6-8d66-694eaae47c12","resolution":{"observed_at":"2026-08-07T15:27:41.661879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:41.791141Z","title":"Relational knowledge distillation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.791141Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:0361c812913eccb090deb80f61091c7b227f74ee081b5dc14581261a17cac1b6","observation_id":"1c1127a6-305c-42a6-b0a5-c75c7b0fa479","resolution":{"observed_at":"2026-08-07T15:27:41.791141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10699","last_updated":"2022-01-24T19:12:34Z","snapshot_observed_at":"2026-07-06T08:31:42.308496Z","submitted_at":"2019-10-23T17:59:18Z","title":"Contrastive Representation Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10699","snapshot_observed_at":"2026-08-07T15:27:41.869574Z","title":"Contrastive representation distillation,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.869574Z"},"links":{"cited_paper":"/paper/1910.10699","citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:758fbad15ab42ab1a2225815645a030084b66eb0701d79053c6276101374ea5d","observation_id":"a3818fe6-56fc-416c-b67f-1a76cca1fc33","resolution":{"observed_at":"2026-08-07T15:27:41.869574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:42.193331Z","title":"A comprehensive overhaul of feature distillation,","venue":null,"work_id":"276bd000-55d5-485d-8d7d-7bc7ad05212c","year":2019},"citing_paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:41.962913Z"},"links":{"citing_paper":"/paper/2505.15133"},"observation_digest":"sha256:4e9a5ecd7c1e86a1f3b6f3bf9309c0422ec3ff4d62f0b4ff2329bc834e6a214d","observation_id":"902d1831-01c9-401f-82a4-cdd4acd83bf9","resolution":{"observed_at":"2026-08-07T15:27:42.274448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15133","last_updated":"2025-05-21T05:38:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:21:02.215243Z","submitted_at":"2025-05-21T05:38:57Z","title":"DeepKD: A Deeply Decoupled and Denoised Knowledge Distillation Trainer"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.15133."}