{"as_of":"2026-08-14T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c49803fa148943f9caee2dafbf4d4a07be6ef5b724bcca54a2df783b52acc018","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:13:40.619297Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:48:45.818794Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T08:50:46.426802Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"cited_work":{"arxiv_id":"2412.08139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08139","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wasserstein distance rivals kullback-leibler divergence for knowledge distillation","venue":null,"work_id":"f7e8f754-93e2-4399-b933-8ac0c2c82ef9","year":null},"citing_paper":{"arxiv_id":"2602.01265","last_updated":"2026-04-30T13:24:30Z","snapshot_observed_at":"2026-08-02T16:45:22.748178Z","submitted_at":"2026-02-01T14:54:34Z","title":"BicKD: Bilateral Contrastive Knowledge Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:48:45.818794Z"},"links":{"cited_paper":"/paper/2412.08139","citing_paper":"/paper/2602.01265"},"observation_digest":"sha256:f69a5647965e428e775994a9d95dc1c5a7094d0331c82f61d120eb2702c6faee","observation_id":"fa6a2b10-2f90-43d5-bc50-692519d47c41","resolution":{"observed_at":"2026-05-16T08:50:46.429057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08139/citation-record","integrity":"/paper/2412.08139/integrity","json":"/paper/2412.08139/citation-record.json","paper":"/paper/2412.08139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.407932Z","title":"Knowledge distillation: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.407932Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:e83d31cf2940af978aff95efd8ac84f1beec6296fabd3136ea71a24208d0e62b","observation_id":"18ca3308-1182-4194-8fe2-3689d2b692d3","resolution":{"observed_at":"2026-08-11T18:13:39.407932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T18:13:39.476696Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.476696Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:9e7f6010c11d83b173f53c93bd96b9446373f05f82b87495a6285f12d5646dc1","observation_id":"aba72c8c-dc16-4c74-b3a0-91d51ac3deb0","resolution":{"observed_at":"2026-08-11T18:13:39.476696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.514860Z","title":"Decoupled knowledge distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.514860Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:bd5c26e6c7ccc9b75c93ffcede2ee51ff4cbfbd5019d7c2c3d93e2a13107f483","observation_id":"013d9a2a-66ae-407c-84ae-e52d18821be9","resolution":{"observed_at":"2026-08-11T18:13:39.514860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.519162Z","title":"From knowledge distillation to self- knowledge distillation: A unified approach with normalized loss and customized soft labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.519162Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:b23e8dc694fb947dd0bd2e3a10c2fb46e72e53622a85d3acf26f88c96e640189","observation_id":"3cdf955b-01ba-4672-9292-4f96d628cb47","resolution":{"observed_at":"2026-08-11T18:13:39.519162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.522487Z","title":"Knowledge distillation based on transformed teacher matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.522487Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:f9c4869cd933f5ccda07528aae8aae6c04472436e4afcc8c9526db461cb4f74b","observation_id":"d26202df-ebe0-432b-b02c-ae593d0ef8fc","resolution":{"observed_at":"2026-08-11T18:13:39.522487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.411270Z","title":"Exploring inter-channel correlation for diversity-preserved knowledge distillation","venue":null,"work_id":"f9187522-f263-410a-ae83-ec18fb3ac491","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.525911Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:024500821f4ac2c5d7e6e23beca71589ee91d1402f47fdcd0dcd7287d0500eda","observation_id":"f02ab123-cb82-404a-be2c-d6fc35a7b070","resolution":{"observed_at":"2026-08-11T18:13:41.416549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.397649Z","title":"Better teacher better student: Dynamic prior knowledge for knowledge distillation","venue":null,"work_id":"639bebbd-9b7a-4425-9f12-2b23d2cf25d0","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.530169Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:78c3f4ea30dc05bbe6ce574c398ef66b393d4caa6c88ef211a6f9fbfe752a8cf","observation_id":"c3a47f9b-c9f6-448c-af39-3a532efcfb84","resolution":{"observed_at":"2026-08-11T18:13:41.403698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.389693Z","title":"Function-consistent feature distillation","venue":null,"work_id":"1fb37f47-a7e7-4c3f-8daf-9e6088677237","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.532816Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:7887ba997487e45a57981bc31067f30fcc73abdb02393728dcecb0e41888e834","observation_id":"44414e35-c312-4e16-8ec1-8c79433aa5fc","resolution":{"observed_at":"2026-08-11T18:13:41.392705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.536674Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.536674Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:eb091f2e939f0a3881fb7833e08b5568b32f11aaef3ecd349ce1d872948e504f","observation_id":"513f93ea-7544-43fb-8223-e45072b97cc8","resolution":{"observed_at":"2026-08-11T18:13:39.536674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.378590Z","title":"The Elements of Statistial Learning","venue":null,"work_id":"17cff9a4-9ae7-45ea-b5ed-114eb98ae9fd","year":2009},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.539419Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:95293df7e8f197eb745538aefa3d81825ba34232683d56cc49cb37ee4bf36fe7","observation_id":"16f5423c-e155-4323-b50f-b76fbf8da08d","resolution":{"observed_at":"2026-08-11T18:13:41.381436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.542385Z","title":"Wasserstein generative adversarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.542385Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:fa8c02d397cd65dddc923932e147385aa7b28dd45e69c01f3b9ebecf01b6a960","observation_id":"dc989820-7429-4fc5-bb7f-63cbac7a0715","resolution":{"observed_at":"2026-08-11T18:13:39.542385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.363823Z","title":"Abou-Moustafa and Frank P","venue":null,"work_id":"69291f56-a749-4c7d-ba12-9988299769ec","year":2012},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.546015Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:4605068a62eab7e7288366a1828d098928ea918af618bec819f63712d8db40c1","observation_id":"07436eaa-9b39-45eb-9242-77c82b1ebc27","resolution":{"observed_at":"2026-08-11T18:13:41.366510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.355257Z","title":"Wasserstein dependency measure for representation learning","venue":null,"work_id":"c870e490-107b-42b6-baaa-16688726ce61","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.548665Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:bfe3624c1bf60306aa897a9a8b9f61f528cac9bebd21a882dcc6b575a7d31a6c","observation_id":"844301ba-cdd4-4e8f-9939-81676457b4b3","resolution":{"observed_at":"2026-08-11T18:13:41.358080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.615333Z","title":"Computational optimal transport: With applications to data science","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.615333Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:96a39f7c7deedb116f85c70b1e8b8fa493703977932d8283db9e1754ccd52775","observation_id":"dbbd8e1b-da28-4d00-8c54-2788ee02f16b","resolution":{"observed_at":"2026-08-11T18:13:39.615333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.342391Z","title":"Wasser- stein contrastive representation distillation","venue":null,"work_id":"9ad998c5-1703-47bd-b8d0-f1365097faac","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.720877Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:e720d37352750af61871d4831bb3c52d7183f27046dfe36ebdaeb6fb61c4acd6","observation_id":"e49c4aa3-deab-4125-8875-e46a223ef060","resolution":{"observed_at":"2026-08-11T18:13:41.345314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.333867Z","title":"Model compression using optimal transport","venue":null,"work_id":"e140a35f-4662-4c89-abce-30fff8a5dcda","year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.800976Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:265ed5f3111858f217fabae49ac81c269fe9b789071b491df1e2c53bdd1f4a49","observation_id":"58c0c442-a277-482f-a2dd-22f7b2e43c02","resolution":{"observed_at":"2026-08-11T18:13:41.336880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.324588Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":"6d45fd75-71a1-4556-98b6-58990e6643e3","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.804204Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:8612ade4c4046aec6dddc5b0b1c90e8c697b056c25897c823fb870149703b967","observation_id":"867c7251-4ac0-4445-b13d-56c5d79a26e8","resolution":{"observed_at":"2026-08-11T18:13:41.328071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.316229Z","title":"Algorithms for learning kernels based on centered alignment","venue":null,"work_id":"ba133467-74cd-40bd-95b9-37fe7f587a15","year":2012},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.807906Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:1a02116a82d712c5af14416934ce73479dc09aecb7437e66c9d250be7e76bf9b","observation_id":"e7455fcf-28b9-4eb1-9f56-29691da32a18","resolution":{"observed_at":"2026-08-11T18:13:41.318834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:39.810818Z","title":"Pattern Recognition and Machine Learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.810818Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:e130676af640b27acca5346e88f5e8111cb9301408ee88ba5cdd0780a73342c8","observation_id":"04d397dd-2e23-4fd9-bb60-e7e1196015f6","resolution":{"observed_at":"2026-08-11T18:13:39.810818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.297244Z","title":"Wasserstein Riemannian geometry of Gaussian densities","venue":null,"work_id":"7af9130f-5f23-4ff8-a5b4-f479243c293e","year":2018},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.814307Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:2778fe86cdc65550967e9a27060345e45ddcdf872a2b7b90cae1d03f57ba29fe","observation_id":"51799ded-5a34-49b8-8a5a-b577e417a791","resolution":{"observed_at":"2026-08-11T18:13:41.301361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.289081Z","title":"Measuring statistical dependence with hilbert-schmidt norms","venue":null,"work_id":"b76db87b-7d74-4706-860f-f3d0dbb682f2","year":2005},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.817125Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:d834c78faad6fd8e23a6e879c5dc534cbc19b458310dbb4cdbc14592000e3256","observation_id":"dbf34b77-6060-4120-a6c4-0b42ab81005d","resolution":{"observed_at":"2026-08-11T18:13:41.292119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.280591Z","title":null,"venue":null,"work_id":"06d2475d-9b88-43f7-bbb2-75477a16bbbd","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.819742Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c32c537587391c5d1b8ff0c6e76a5a7cc106b192eddd80b4257f96246604deba","observation_id":"ec982d4b-74f1-41d9-aa4e-91813a909924","resolution":{"observed_at":"2026-08-11T18:13:41.283318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.272006Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport","venue":null,"work_id":"ebf24160-cc24-4fda-8626-e70ac6429777","year":2013},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.822052Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:bb263d713f9957a1d2c296b89ce88f42fed8f461dbf3ecbdc2b34767a0d4e184","observation_id":"1b5cfe3f-4b4b-4f18-a187-eb5f216b23ec","resolution":{"observed_at":"2026-08-11T18:13:41.275306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.263463Z","title":"Fitnets: Hints for thin deep nets","venue":null,"work_id":"fa2b1b0a-dc40-43ba-8080-0daae0baf5c1","year":2015},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.825602Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:3dd257db3accd24f8b207d9322bcc4f2e88a4e9f250b771f1695e8f4c52fecb8","observation_id":"9233f7fc-fc8e-4b56-9159-e296933b9a8f","resolution":{"observed_at":"2026-08-11T18:13:41.266729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.254090Z","title":"Contrastive representation distillation","venue":null,"work_id":"ff3984c1-d40c-480c-a3a9-5e3a623d05f7","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:39.956639Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:3364777767040ecaba67803841407d17763af5e9a05ca1c050bc21f45ba7b9ff","observation_id":"ab479a94-6e6b-41ef-9210-1b08cfa650c1","resolution":{"observed_at":"2026-08-11T18:13:41.257079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.245273Z","title":"Improved feature distillation via projector ensemble","venue":null,"work_id":"c2af9730-2158-40ce-a1b2-e57b23ba14a4","year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.006357Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:849c3dcc80ccbaf89bd31655dfefbd847907adc8caa49f8d57b1d66d7b201460","observation_id":"bf173e6b-eefa-4b47-a0d0-37a4f7febaca","resolution":{"observed_at":"2026-08-11T18:13:41.248460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.236642Z","title":"Journal of Multivariate Analysis, 88(2):365–411, 2004","venue":null,"work_id":"fb42186c-5a26-4295-a25b-e4eba187b34b","year":2004},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.023484Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:26e3a68ead603aa4a8e5940b5ab48fe68e798456038442b305bcda0d7e2fde7e","observation_id":"0ad833ac-9210-4932-b848-80b823b22ab4","resolution":{"observed_at":"2026-08-11T18:13:41.239523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.227374Z","title":"Spatial pyramid pooling in deep convolutional networks for visual recognition","venue":null,"work_id":"a7642664-b509-49aa-a231-ea44a1118696","year":2014},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.026694Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:515bb426aa360f834b0cd235ea7bf8eef75ef649c87dfd4adb92a99b224c18af","observation_id":"73f13f7d-0fdc-4372-bae3-addf917bc929","resolution":{"observed_at":"2026-08-11T18:13:41.230356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.217368Z","title":"Distilling knowledge via knowl- edge review","venue":null,"work_id":"2103e44b-85ad-4c60-a9a1-0360317569fb","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.029550Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:6179f4655ad9c3d0c3852c3d80b54dd46e17aff828f3a4a7258c6be0d5b24995","observation_id":"a3383a1b-1211-49a7-9e7d-222ec593329e","resolution":{"observed_at":"2026-08-11T18:13:41.221531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.208769Z","title":"On information and sufficiency","venue":null,"work_id":"f575b837-b3a4-4c89-9a69-1e2c4d00979c","year":1951},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.032790Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:356ab961edefe5390e1d2bd06912347cc4182152c3fcdeec2a69bdb29334a55e","observation_id":"669ddbdf-78fa-43af-a2ff-e441266f5d51","resolution":{"observed_at":"2026-08-11T18:13:41.211610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.036315Z","title":"An invariant form for the prior probability in estimation problems.Proceedings of the Royal Society of London","venue":null,"work_id":null,"year":1946},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.036315Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:ad5fdb5788391040f51afa8c39b890baa84fc9567e36903f7816567bbd0893b2","observation_id":"f66f0815-7a4d-4f6b-8f47-eccb22b88235","resolution":{"observed_at":"2026-08-11T18:13:40.036315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.193969Z","title":"From sample similarity to ensemble similarity: probabilistic distance measures in reproducing kernel hilbert space","venue":null,"work_id":"c3f664a0-49cc-459f-bf9a-60cd21a6c961","year":2006},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.038978Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:8277349df369dbf4e006c55c0b4fd7204bfcebb414be3ee5c351cfe6bbd127d2","observation_id":"8b739f87-1b2b-43ee-8576-a8fb75cc927d","resolution":{"observed_at":"2026-08-11T18:13:41.196690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.186459Z","title":"Deep CNNs meet global covariance pooling: Better representation and generalization","venue":null,"work_id":"badc5da4-08e9-4abf-b604-a1402eda4d26","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.041701Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:60f147c133301f8fb537b75381270bd25107574fe29fc324ff091b7ee67be7d9","observation_id":"e6f6725b-82c1-4e77-849e-fcd176062842","resolution":{"observed_at":"2026-08-11T18:13:41.189391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.178343Z","title":"A fast proximal point method for computing exact Wasserstein distance","venue":null,"work_id":"2199cea6-e547-4037-b4a4-4ffb60f2f111","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.045368Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:9567f09795c8137f547278d7715db9772cf0aba54c142f1d13b98a52b054bf8a","observation_id":"56fbbd5f-776c-48a0-b714-d64783db393a","resolution":{"observed_at":"2026-08-11T18:13:41.181535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01219","last_updated":"2017-12-18T22:35:22Z","snapshot_observed_at":"2026-08-12T07:59:55.408605Z","submitted_at":"2017-07-05T05:44:02Z","title":"Like What You Like: Knowledge Distill via Neuron Selectivity Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01219","snapshot_observed_at":"2026-08-11T18:13:40.048004Z","title":"Like what you like: Knowledge distill via neuron selectivity transfer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.048004Z"},"links":{"cited_paper":"/paper/1707.01219","citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:6c0cf55457348d4b02b8fb5158996e175334dc898d9b9c6fa519b5063e5ed540","observation_id":"f977b480-bd46-4be7-9f37-e28f8798a8ec","resolution":{"observed_at":"2026-08-11T18:13:40.048004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.090253Z","title":"Paying more attention to attention: Improving the performance of convolutional neural networks via attention transfer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.090253Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:0f354df1464a73bec6bdf7bef3432a7363153198e0e63712bb6b05ca3dde6236","observation_id":"42eac153-1d29-4b8e-93cc-5b961330a26e","resolution":{"observed_at":"2026-08-11T18:13:40.090253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04289","last_updated":"2020-03-09T17:50:12Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:50:12Z","title":"Knowledge distillation via adaptive instance normalization","version":1},"cited_work":{"arxiv_id":"2003.04289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.04289","snapshot_observed_at":"2026-08-11T18:13:40.658893Z","title":"Knowledge distillation via adaptive instance normalization","venue":"cs.CV","work_id":"196acfed-af5e-46d8-b14f-46542de0027c","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.134972Z"},"links":{"cited_paper":"/paper/2003.04289","citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:ecebe5307f2a23c47be833f1c90f3040a26d8335b21964ef9ebbdc70c2d26ea9","observation_id":"d5f34445-eb9d-4587-9010-2e3808b557ff","resolution":{"observed_at":"2026-08-11T18:13:40.663853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.163622Z","title":"Positive Definite Matrices","venue":null,"work_id":"cc850f6b-9351-4867-bfaa-00f32e525ef1","year":2015},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.178724Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:0480f2cb160a7ae9837087f38625f6f5c1aa753c055397b0aba90b1318065d01","observation_id":"35ee1285-5813-4594-93eb-085a124e7ae9","resolution":{"observed_at":"2026-08-11T18:13:41.166459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.150384Z","title":"Dimensionality reduction on SPD manifolds: The emergence of geometry-aware methods","venue":null,"work_id":"9edbf316-0d4e-44e8-9ebc-f31dc40ddd6f","year":2018},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.182277Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:4ab367f515265f5ef226a0d1aea60ab4ba251d3f0b538409b952b7e1f7ec6e89","observation_id":"6e3fb577-252a-4d8a-be7d-9488e5b3cbf1","resolution":{"observed_at":"2026-08-11T18:13:41.154619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.141507Z","title":"Lawrence, and Zhenwen Dai","venue":null,"work_id":"32a604f1-ff4f-460c-ab48-303ce92593eb","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.185548Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c412f659356d875d6ab64673f99b7dbdc5b91a7b85656c94d2947c76b179f99b","observation_id":"3f79fb90-e1b3-4ae0-ba0b-09326a6d77bd","resolution":{"observed_at":"2026-08-11T18:13:41.145003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.132982Z","title":"ImageNet: A large- scale hierarchical image database","venue":null,"work_id":"7bc89bae-d5c3-4b58-a2e9-240716bf3ab7","year":2009},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.188016Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:e93ba22c7b127b84ad78a85b32a18443bd1ee4f8381188e79854fcc8edc45021","observation_id":"d182fcb6-23e9-4d98-9618-c658f5319b32","resolution":{"observed_at":"2026-08-11T18:13:41.135991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.191186Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.191186Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:1d82f11760728343e8e2a3f9abcab0ec13277a38fa602062ebde3f615c32a3fe","observation_id":"958a879c-5d5c-404d-9b01-c94e7919c414","resolution":{"observed_at":"2026-08-11T18:13:40.191186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.117069Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e239dc5a-661e-42a7-b77b-8e0cb55ba10c","year":2014},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.194372Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c1ac29033c9f494c8a400b8557f61224fb71bc26613fe8fe2d75803f2e03dc4a","observation_id":"673c3bd8-20cc-462d-834c-0648c6e4c177","resolution":{"observed_at":"2026-08-11T18:13:41.120247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.106317Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"f130f698-4411-4425-98e7-81c428d4814b","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.198296Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:66314299121ee2335e9898fd62c04849baffefec356decce0055749b612d4590","observation_id":"eddf9aa6-7e5d-4160-82c2-736caf4f2f73","resolution":{"observed_at":"2026-08-11T18:13:41.110698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.094137Z","title":"Alaya, Aurélie Boisbunon, Stanislas Chambon, Laetitia Chapel, Adrien Corenflos, Kilian Fatras, Nemo Fournier, Léo Gautheron, Nathalie T.H","venue":null,"work_id":"d98bc7ef-ee70-4c63-848b-ef151f44042c","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.201140Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:9672f7b89cd2c47297b9f51a0253288a8c84bc0caeaa9f7af239718e419a5675","observation_id":"cc505936-a06c-467d-97a5-18e8c1b06587","resolution":{"observed_at":"2026-08-11T18:13:41.097417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.085276Z","title":"One-for-all: Bridge the gap between heterogeneous architectures in knowledge distillation","venue":null,"work_id":"0a51ef4a-baae-40e5-9ad7-dd96621d409b","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.204118Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:7d8ded524771cfe3127f831b62ddecd0ad132bdcaa559484102235460868f6ec","observation_id":"0d2080e3-8f95-41e4-9fa1-c5d6f882cf86","resolution":{"observed_at":"2026-08-11T18:13:41.088965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.075725Z","title":"Faster R-CNN: Towards real-time object detection with region proposal networks","venue":null,"work_id":"43e7c2dd-4814-43c2-a6fb-a8f63205c69f","year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.227866Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:74c0a4e9c586cc04f7aa6d656d95d9e3c5b9c75f669585bd66f1132e26b996cc","observation_id":"beda3083-0b75-4d6c-bd2e-27dfc8650a3b","resolution":{"observed_at":"2026-08-11T18:13:41.079514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.263930Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.263930Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:79a2fb9a00aab5835f977a7199a7895b3c1245beb6d47ae9ced2c61361e772b4","observation_id":"7208354e-97a9-45e4-8d0e-23ba0d93f619","resolution":{"observed_at":"2026-08-11T18:13:40.263930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.272633Z","title":"Detectron2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.272633Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:043802d2cb1cffb61a0ab6dca397aa3b0c06a52b3509df0a9a7d3b4ea90c09c9","observation_id":"385a90cd-f267-47aa-89c1-e5ee7fe521d5","resolution":{"observed_at":"2026-08-11T18:13:40.272633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.055768Z","title":"Distilling object detectors with fine- grained feature imitation","venue":null,"work_id":"7f9f01dd-98ee-46b9-808c-929479080f7c","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.276381Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:a1ae8d7b0498d571c02d3f872ed0e65d7b8920cd039e5f99df41cf989ef0e2f9","observation_id":"485c9d8a-f810-4907-bc6b-72d1c72661c1","resolution":{"observed_at":"2026-08-11T18:13:41.059334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.046686Z","title":"Instance- conditional knowledge distillation for object detection","venue":null,"work_id":"198368a2-f63f-4eef-b367-9a97ee5c986e","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.279814Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c13d13f284528285d3cf2b5989efd0c4bb409b42ecf88380b4bf8927a34a8b79","observation_id":"e9694932-4810-42d6-a4ef-ee9a8161553a","resolution":{"observed_at":"2026-08-11T18:13:41.049970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.037080Z","title":"Elementary estimators for sparse covariance matrices and other structured moments","venue":null,"work_id":"eb9d595a-49b2-4c4f-b364-299c00379f10","year":2014},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.282928Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:ddac364c571d2cb78770815c3a135fd82ce31032a37d02e006d3d67408483952","observation_id":"6a6e7623-2628-4143-bce5-d79259bfe52c","resolution":{"observed_at":"2026-08-11T18:13:41.040390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.027724Z","title":"On rényi divergence measures for continuous alphabet sources","venue":null,"work_id":"ab9f7cd3-eada-4849-ba88-5870fe882110","year":2011},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.285921Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:de1b0c84bc379ef899c38f43724dbe6bd834de45acf936939b8cb66acf83db89","observation_id":"3da8b5f3-6bbd-4bcb-a184-362d74de197f","resolution":{"observed_at":"2026-08-11T18:13:41.031610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.018580Z","title":"Curriculum temperature for knowledge distillation","venue":null,"work_id":"2f007b7a-680f-4222-a1e7-d4cf8fb78c30","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.289794Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:5fdb61771d6a63b86d2800a2e284e4962014b91d92a2a50b0c26434cca2fbd81","observation_id":"65b84277-5176-46a5-9b7f-e410dd83a6b4","resolution":{"observed_at":"2026-08-11T18:13:41.021344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:41.008637Z","title":"Class attention transfer based knowledge distillation","venue":null,"work_id":"699bc876-368e-4695-b41d-ee21d4c7e42c","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.293149Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:6a959b6aa573f005593dc23edc1d65130a0c5a6e3d651140b0a5ea85e5e21051","observation_id":"5eee052d-7475-4726-a7ae-94dbc5165e6d","resolution":{"observed_at":"2026-08-11T18:13:41.011658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.882118Z","title":"Kd-zero: Evolving knowledge distiller for any teacher-student pairs","venue":null,"work_id":"92d25303-9e7f-4959-88b1-02159363e6a9","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.296266Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:9734f837008c8b918ccd0f5a1d7ba53dcf13cc2e7ac2e3f324c795920fe8de39","observation_id":"c4ac3cb1-40ff-45b1-ae09-e4a72aab88bb","resolution":{"observed_at":"2026-08-11T18:13:40.999706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-11T18:13:40.306129Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.306129Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:47ea8aa4355b77a57e906618818266c0f3cacfdaf0a860dea76c1988c870c21c","observation_id":"248a95b6-1bcf-4e7a-b437-ad2b27f1463c","resolution":{"observed_at":"2026-08-11T18:13:40.306129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.309277Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.309277Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:837346386013e2547c164a0b57a1917611f81345060c0f9f49dce3374c9d8e9d","observation_id":"f6125a51-2dea-4872-89ac-280bade33136","resolution":{"observed_at":"2026-08-11T18:13:40.309277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.311946Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.311946Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:5397ba84768a83c6b8f8196bb6ba2e14b7d1b332ed9be24d7ab6b2f44094f0a7","observation_id":"8a4ed2db-7bd8-4de2-8917-ffd54e191b1e","resolution":{"observed_at":"2026-08-11T18:13:40.311946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.314749Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.314749Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:618cd4936f15ae9cd8d9c75b13ef363c70684df5c4619ec9f8d68fae02806078","observation_id":"efa47d41-2185-4d58-b61b-0c1ce25b2a6c","resolution":{"observed_at":"2026-08-11T18:13:40.314749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.367756Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.367756Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:68c82851b4b5c0da7eebb6d77fa3853fc9d5517ab9b2588485e10590a587b282","observation_id":"ee1a5d5f-2085-430a-996f-ebf424cba8a2","resolution":{"observed_at":"2026-08-11T18:13:40.367756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.458933Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.458933Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:0a55f8ae3555499f056a61d510fedfd3f207f18e92dd30e664e8bc705aaa7db9","observation_id":"4b83ac21-f702-4cd5-a416-7fc1af9cd177","resolution":{"observed_at":"2026-08-11T18:13:40.458933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.847873Z","title":"Knowledge distillation from a stronger teacher","venue":null,"work_id":"aa44493c-55d8-4fae-ab41-c8f8537cf67b","year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.461490Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:a8b6b7924eae8e455896efe2f000d7e3bc93fc103a1e83e7dc0b217462c8cf02","observation_id":"3968423a-f50f-4700-b8db-8d2bf8d06fd4","resolution":{"observed_at":"2026-08-11T18:13:40.851435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.838544Z","title":"Correlation congruence for knowledge distillation","venue":null,"work_id":"01f76e10-dfaa-44e4-bb3f-fbb25c5af67d","year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.465416Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:323bbeefeb55bb8c99ac1560e90b4500492251c73bea63a17b5784c707e26a74","observation_id":"89d4b15c-af3a-4e1f-a886-ef5ebb2d37ea","resolution":{"observed_at":"2026-08-11T18:13:40.842497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.468352Z","title":"Relational knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.468352Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:49920c06a65ac1a1547ac2a3b54ce29f3676a9b6787ef3dcde48c9033dc02c0f","observation_id":"119f7532-f51e-412e-a282-c1fa10a7be69","resolution":{"observed_at":"2026-08-11T18:13:40.468352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.471879Z","title":"Born again neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.471879Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:2fb9e2ff263e58dfef4ac050733386d34b102b19131fd70534099a19b6e3fc2d","observation_id":"9a529735-3f3f-4be4-879a-b16211d89017","resolution":{"observed_at":"2026-08-11T18:13:40.471879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.820160Z","title":"Revisiting knowledge distillation via label smoothing regularization","venue":null,"work_id":"0e345bee-553d-4a08-bd16-a306ed8a588a","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.474552Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:d4b15b4a1693fa8ecb22cab65956315fa8063aea6a01adaddd37d5de1f93a8b4","observation_id":"b40782d0-10ce-42ea-bf85-c8fab831c379","resolution":{"observed_at":"2026-08-11T18:13:40.823746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.809140Z","title":"Refine myself by teaching myself: Feature refinement via self-knowledge distillation","venue":null,"work_id":"ac3a9e8f-2443-4ac4-a416-72bf45226bbf","year":2021},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.477368Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:caa48884ee34e2814b9102b8cd75731ce4c5d867dbcde0cda9616ddde0ef565b","observation_id":"46c8e9fb-e9ba-4900-979c-517f8824d62c","resolution":{"observed_at":"2026-08-11T18:13:40.814075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.798439Z","title":"Efficient one pass self-distillation with zipf’s label smoothing","venue":null,"work_id":"e916252d-4ed8-4c7f-bc33-e564545638be","year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.481161Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:7c51032b9269f2e16a97529bc9e648c15de68a14d57733398cad55e5fb88b3eb","observation_id":"e52d822e-646b-4acc-b7c2-01c39ac7d3dd","resolution":{"observed_at":"2026-08-11T18:13:40.802930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.789227Z","title":"Near-linear time approximation algorithms for optimal transport via sinkhorn iteration","venue":null,"work_id":"bb7a06bc-571e-4bd4-b5d7-78899998d8e1","year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.484221Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:b332918701c1d59b5f36a613085000e2d3695bbab92b78b66874ac30746fb09b","observation_id":"359f7aa4-3e60-4f67-b203-3626e8c3f24c","resolution":{"observed_at":"2026-08-11T18:13:40.792855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.779837Z","title":"Masked generative distillation","venue":null,"work_id":"621d7591-5753-4cb3-9133-8c1f09193a57","year":2022},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.487178Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:871d996001103ed12f1ea91fbe25238c002b3856eef83693162c6b3ae41c67aa","observation_id":"7adb055f-a372-47b9-a5ed-7f1c9736597b","resolution":{"observed_at":"2026-08-11T18:13:40.783397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.770514Z","title":"Knowledge diffusion for distillation","venue":null,"work_id":"b077a04f-7191-47de-b653-f50193b02382","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.489611Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:4a691e69a554140b2fa1bad31ce75646aac398a2f28aabff0d6a7c19e82c6eeb","observation_id":"750a9e92-3fe7-41d0-bedb-d6dc4ee07fc8","resolution":{"observed_at":"2026-08-11T18:13:40.773376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.760158Z","title":"Multi-level logit distillation","venue":null,"work_id":"65580f35-cf8a-4920-84e4-63e72ea6aae1","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.492440Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:7905534cc4d2e1be2c2c5d68a9f441300ae4993126d841d3cd8cae99198237b0","observation_id":"e1e805b7-550e-4553-9f72-970f82d2daee","resolution":{"observed_at":"2026-08-11T18:13:40.763874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.750316Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"fa7a8db2-8e8e-430e-9272-93abf81fd5d0","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.549911Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:0496152881264015368ebbeb3cd2062e5c2dc25c6909c7db8fbc4d084f3d0877","observation_id":"4b955287-3d19-4057-852a-b33ffae3276d","resolution":{"observed_at":"2026-08-11T18:13:40.754166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.741416Z","title":"Revisit the power of vanilla knowledge distillation: from small scale to large scale","venue":null,"work_id":"962a696a-7c3f-4008-a781-b10fc41d79fa","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.589696Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c7a14e9da50c8852c410df69e893ebcdd2e4969d69836ec6ca91adb27aa54dd7","observation_id":"b6d81607-a135-477a-bf35-6dce15074d83","resolution":{"observed_at":"2026-08-11T18:13:40.744729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.592910Z","title":"Wide residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.592910Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:c4ccfba9be8e738d03c9af9904e8d8bdac15d7852a5453bd5f88e74038c1b09f","observation_id":"dd8b6cca-8348-4192-bb9a-86c1579fb3b4","resolution":{"observed_at":"2026-08-11T18:13:40.592910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.596707Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.596707Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:6eb74ecd4191aecd8c309e95f8adae19ca92a3879affd2312fcd7ac8d342a238","observation_id":"eefaace2-5ed1-4ea7-8f25-883b9c22da83","resolution":{"observed_at":"2026-08-11T18:13:40.596707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.724736Z","title":"Shufflenet: An extremely efficient convolutional neural network for mobile devices","venue":null,"work_id":"a533d185-917d-4e3f-b2c4-f5e3ca0d1b35","year":2018},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.600196Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:8b321d75d7800b217fbbed63aafd7d2409528ae0ccac9320a860774d3c6289c3","observation_id":"618a6903-d25f-4bc5-a6da-5f8fab452134","resolution":{"observed_at":"2026-08-11T18:13:40.727571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.603731Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.603731Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:65ffe3a2f2097eaf3284cb9f0afb429813cc48dfdb0cfe055b3f5976b3f2ecb4","observation_id":"e79a6529-81c3-459f-9a44-ef80b8b08c2a","resolution":{"observed_at":"2026-08-11T18:13:40.603731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.713309Z","title":"Distance-iou loss: Faster and better learning for bounding box regression","venue":null,"work_id":"a3ff18f2-d0a4-4fa5-a446-76b7833a57f3","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.607563Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:b0f47a568c3b537343d72cb35ea59a014206165a4cca30813e57062642c6aa4f","observation_id":"cbfc7846-3246-4077-a6c6-02a95c0868bd","resolution":{"observed_at":"2026-08-11T18:13:40.716189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.703195Z","title":"Revisiting knowledge distillation via label smoothing regularization","venue":null,"work_id":"623e8882-fdbb-492b-baa6-8f4105dd5c06","year":2020},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.610444Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:029effc84ab2110468069e11f1415ed9cdf3bba772f051cf65cc4710faa29322","observation_id":"927c71a4-10c6-460b-bac8-2fd1e07fadbe","resolution":{"observed_at":"2026-08-11T18:13:40.707734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.692075Z","title":"Language models are few-shot learners","venue":null,"work_id":"bfd1b16d-7519-469c-8345-d3006b1de437","year":1901},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.613292Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:fa75807075c343c6e802c206614a2d1a861cbe8026497708b53f5bb18a8778f9","observation_id":"84fe2b49-bfc3-4be7-a890-bb56ee1795f5","resolution":{"observed_at":"2026-08-11T18:13:40.695709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T18:13:40.616182Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.616182Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:b65da7494e666a86520dcd7d8ab26562a83280b69dec45224ac96ef63463f4c9","observation_id":"ef97d470-b605-4e0c-bda4-620f5ccc40f6","resolution":{"observed_at":"2026-08-11T18:13:40.616182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:13:40.683911Z","title":"What knowledge gets distilled in knowledge distillation? In Advances in Neural Information Process- ing Systems, 2023","venue":null,"work_id":"620b4629-7975-4834-91a6-a8960835d8a2","year":2023},"citing_paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T18:13:40.619297Z"},"links":{"citing_paper":"/paper/2412.08139"},"observation_digest":"sha256:60bb0db20720062c34a0ce694bef5cb5a0dc8be97230204aa2aeed51bb4a7d00","observation_id":"87497aee-7062-4edf-a305-9849419847ad","resolution":{"observed_at":"2026-08-11T18:13:40.687072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08139","last_updated":"2024-12-11T06:54:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T18:07:33.743772Z","submitted_at":"2024-12-11T06:54:39Z","title":"Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":55},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 1 inbound Pith citation observation for arXiv:2412.08139."}