{"as_of":"2026-08-07T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61ec6bbf0fa0135c6b41002df08cd14a803c2c8739e071b547ce8bda37211e54","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:34:48.709434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12370","snapshot_observed_at":"2026-08-02T01:34:48.709434Z","title":"arXiv preprint arXiv:2606.12370 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14647","last_updated":"2026-07-16T07:18:05Z","snapshot_observed_at":"2026-08-06T19:12:57.613940Z","submitted_at":"2026-07-16T07:18:05Z","title":"D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T01:34:48.709434Z"},"links":{"cited_paper":"/paper/2606.12370","citing_paper":"/paper/2607.14647"},"observation_digest":"sha256:a89d6a1844eddeaf59fdf9712ca7d826e5159312f0084c2e9a82f220354dce4d","observation_id":"7b39c9c3-e86a-4261-9322-81a945c9f801","resolution":{"observed_at":"2026-08-02T01:34:48.709434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12370","snapshot_observed_at":"2026-08-01T01:22:13.804729Z","title":"Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25852","last_updated":"2026-07-29T07:31:33Z","snapshot_observed_at":"2026-08-07T09:03:01.202760Z","submitted_at":"2026-07-28T15:25:05Z","title":"AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T01:22:13.804729Z"},"links":{"cited_paper":"/paper/2606.12370","citing_paper":"/paper/2607.25852"},"observation_digest":"sha256:273423c4934f9973355f3ec789e7c29451c34e5434cb28d5036fae47d03319cc","observation_id":"b1262a26-beb5-4bf9-b512-c4321cde853f","resolution":{"observed_at":"2026-08-01T01:22:13.804729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.12370/citation-record","integrity":"/paper/2606.12370/integrity","json":"/paper/2606.12370/citation-record.json","paper":"/paper/2606.12370"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.29343","last_updated":"2026-05-29T03:17:50Z","snapshot_observed_at":"2026-08-02T13:42:11.873594Z","submitted_at":"2026-05-28T04:30:22Z","title":"Draft-OPD: On-Policy Distillation for Speculative Draft Models","version":2},"cited_work":{"arxiv_id":"2605.29343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29343","snapshot_observed_at":"2026-07-04T10:19:47.075627Z","title":"Draft-OPD: On-Policy Distillation for Speculative Draft Models","venue":"cs.CL","work_id":"30a7cfbf-131a-416e-bf78-2e99c91c1d6b","year":2026},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2605.29343","citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:2d6c7436ef46e1db986c12c5843535239e72d45dee2e9777e2fc155eb01a0218","observation_id":"7a1fdafe-eeae-436e-867c-e1b7bb751525","resolution":{"observed_at":"2026-06-27T10:30:51.814090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"The TV gradient is proportional to qj, so it automatically ignores low-probability tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:104a0fb498ffacc586a45d9fc432e3d2b0c99592dbb2c2387ad25e62f6e5c60b","observation_id":"5d0b5a34-4160-4c2e-ad9a-8c1252c72cc3","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"rejected under rejection sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:af77dd59e75db4b277917c68f31742486b769ac5ea58e38509596c0fe7a736ba","observation_id":"358997f3-c559-44c6-a2f9-0f2a1e876189","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"The TV gradient is bounded byq j","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:7b7d602cb80c28cefd7331fda96e96f4c414e32db6827b5d1513688ff74d79b5","observation_id":"a971f4a7-890b-4a1b-887a-74b13de80b7c","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"mode-seeking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:14c34a74a78080f066fe82e4ac70454321f8f0a4dc09ba640e9d05d7cfa7a225","observation_id":"8158ee0a-c955-4abd-95b2-88fff7cb35bf","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"The reverse KL imposes anasymmetric 22 penalty: over-estimation (qj >p j, so log(qj/p j)> 0) incurs a much stronger gradient than under- estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:15e1a050797d479dfa1636c7f7c3b880b8e134ccb58a80224a78129c8216f8f6","observation_id":"de69c6a3-4937-41a7-8aac-f7c89221e1d3","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:538e780de18e1a405bf665a899219763193b83c580a2fd23e637225fdb70d509","observation_id":"d381fef1-2418-4f18-baab-034185babcf3","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:96896c65ef38c84ec42755058bce9c595cf7ebb93122233c7741ba160d05917b","observation_id":"3f4f813b-9737-403a-8f47-1ee4b3bef279","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"Practical considerations.The above analysis assumes δ is a constant, but in practice, the draft head has finite capacity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:1f760f7889fd84e1c0a22bfc385b558f68c79bdcf8b47441d356d69694f1f582","observation_id":"ac4e1006-56f6-4b4b-8a67-1cb43cd31550","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":", γ, draw ui ∼Uniform( 0, 1) and accept ˆyi if ui ·q i( ˆyi)<p i( ˆyi), i.e., with probability min 1,p i( ˆyi)/qi( ˆyi)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:f4fdb01af6c67ac85e3144d555831676dde79ff68572d4fde414aeb1478256ff","observation_id":"bf0256dc-d046-46a2-85d2-54be6555b236","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"For rejection at step j, the residual distribution is presid(v)∝max( 0, pj(v)−q j(v)); for the bonus token (all accepted), the residual is simply pγ(v)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:e57920c093dbdda809170802f42a9cfe961a07d4e41d0382d8cb0478143935ce","observation_id":"8d99502d-fb3f-4b77-afa6-dccfd14566c4","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"The kernel records the index of the first rejected step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:e8bab4701303f326a3b3aa0d6c0bf5a289c759501195418e293d8805248685d6","observation_id":"18c4527f-6d18-42e6-a7cf-84e12de6c290","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:24:34.257293Z","title":"For rejection at step j: zresid(v) =log max( 0, pj(v)−q j(v)); for the bonus token: zresid(v) =z target,γ(v) (the raw target logits)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T10:24:34.257293Z"},"links":{"citing_paper":"/paper/2606.12370"},"observation_digest":"sha256:2c2177a6aae07f07e63050ae19fd7880f25123fe24ad77d7f147e1bdf4118bee","observation_id":"07634fa9-0f6b-4b60-945c-8a00a5d2d8c4","resolution":{"observed_at":"2026-06-27T10:24:34.257293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.12370","last_updated":"2026-06-10T17:36:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:36:45Z","title":"Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 2 inbound Pith citation observations for arXiv:2606.12370."}