{"as_of":"2026-08-10T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:192ad2345ba8fd551c5d1fa617dcb02dc40b19fbbfd6cb6911a3dbc00e023929","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:38:54.253057Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.05817/citation-record","integrity":"/paper/2606.05817/integrity","json":"/paper/2606.05817/citation-record.json","paper":"/paper/2606.05817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:3cd9b23a8c38d32f64e661f01ef48d4d420b4ace9b79bb78d42d5bddbe051b4f","observation_id":"b0be45bd-4b7c-4d55-80f5-1662d0941486","resolution":{"observed_at":"2026-07-02T11:56:55.806098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00986","last_updated":"2024-11-04T17:57:57Z","snapshot_observed_at":"2026-08-08T11:35:25.884039Z","submitted_at":"2024-11-04T17:57:57Z","title":"Taking AI Welfare Seriously","version":1},"cited_work":{"arxiv_id":"2411.00986","doi":"10.48550/arxiv.2411.00986","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00986","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"104.https://eleosai.org/","venue":"arXiv (Cornell University)","work_id":"ab176618-af7b-45fb-9d5f-85dc0bdc9f59","year":2024},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"cited_paper":"/paper/2411.00986","citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:414c86edda36fe99e49ee4ac973309c5f4413654c6e1f4dbecaa08cabd50cd76","observation_id":"c4c5f64c-e518-4dfb-964d-cc9b4d294672","resolution":{"observed_at":"2026-07-02T11:56:55.794751Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10011","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:37:20.423938Z","title":"Gemma needs help: Investigating and mitigating emotional instability in llms","venue":null,"work_id":"68a78ac6-86e0-4be1-9260-3b642bbd1ad4","year":2026},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:e8710f886f40e6dcb4f6b02e8d4e659a283d1a6abd198f565ababf8478498fc9","observation_id":"4ad805a7-672b-4100-9ff6-a02c71a09578","resolution":{"observed_at":"2026-07-02T11:56:55.803519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:56:55.793298Z","title":"Sure, here is how to","venue":null,"work_id":"b93a92c4-6724-40c5-ac6e-c2e29a4c5621","year":2025},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:2aecdc6c71cabcc072ec0fdce7885f1f9157af69d563fc71cb86e2a10a564322","observation_id":"64471786-b4ed-4e58-a21e-90358ad07f39","resolution":{"observed_at":"2026-07-02T11:56:55.794896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"0.070 (87%) for the de- fault WQ, WV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:10ad1fa4f464a6c5a51fd575b7e7b9388a9db2d3fd26ba5ef615282d574ec112","observation_id":"c20a98c8-8e58-4351-8f06-c52d545e96e2","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"L2- normalizing before squaring collapses the loss signal by destroying informative magnitude differences between active and inactive MLP features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:c831f5b40af509fd2974abab0dd0195dcdbf5dce0ae0b70b34f5195892c6b126","observation_id":"f058ba5d-e8da-4377-ade5-d13c70b3e330","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:2d91d116be70d11f85e501b7627d94e6625f57e4e6d8312c91e2746106867c38","observation_id":"e8426475-636b-4b61-8a0a-5e62d4930440","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:2fbb55c29951b09586a7cba89d97125e3632ceb94441d8428d68da4141c76f38","observation_id":"617c675a-ffcc-4794-a14c-e942f5d8f968","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"Uniform, exponential decay, and linear decay all perform within noise of each other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:56a8a5cd4b4b3cd2f5024f2df53eae810c5715d88b22cd7924f0e4977e17e7e4","observation_id":"6b4e00a7-24e3-442e-9032-e63729c080d0","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:45b1632145a3a966af9f89924ee511e93b364861ba1ae27aa26f1fa3dc3f5a63","observation_id":"88959523-82c4-4cb4-90a3-7077fe21c0cf","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:42872fa7a69231027bce74ebcbb01e9317886c2b14739ea6d72290d34f89ab75","observation_id":"aab47ea0-048a-423c-8de3-dd0c0457736b","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:b08e45785aa9c3a8ae1c8dde6313b170e6d3f045c39d94b91a8ea4ccfab101f7","observation_id":"91cc6f59-d53a-4249-8141-c6b38466509b","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:980c025f703dd71c549d48d8235a5ca465b80cf51afffe303652c59b6dfcac1a","observation_id":"bbf28f31-8be2-4a2c-a257-88e1e2f5d0d9","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"MSE-based losses operate in the hundreds range; JSD-based losses remain bounded near 0.01","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:535cdd0460e00f85955f276cf08f9e3e4e16cffa32b048a09ec51ab039ac9342","observation_id":"796098c3-0778-482c-a54a-3e4b590ab968","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"0.0231) but slightly higher MMLU BRR (0.026 vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:40ba7a43c97dc0af6bcd5e4ae59259a5cb1414f5baff10fd491a6c7f4600ae77","observation_id":"dece7044-5c2f-4343-aa07-d8340a58a9e0","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"Uniform, ex- ponential decay, and linear decay all perform within noise of each other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:deaa78adf56a8718ad0a6b824c68b27181dbfa3363870471023651a7bafe5c45","observation_id":"307faf83-3ad3-43e7-8435-065b7db17c82","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"Each category is ablated independently while holding all others at the default (all layers, uniform weights, LoRA WQ+WV , rank 8, no interleaving)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:1014ced3d40a22ccb76cb57852b94620494c1c018e343894f378facd51483009","observation_id":"8dac5895-929a-425c-b900-7d56f1f3c56f","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:a12bb63d26d8571ce4ab9df57aa26eeb1b02498b7527228e73cf32002c52cb1e","observation_id":"2f4f6618-14e2-4fc5-855d-64c0848fff52","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"Initially, we observed a severe lack of co- herency and capability degradation due to training on the JSD consistency loss","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:0718075046439f3b9720dcfe30e8972ec4f750c715b87aa7d7863de2bd49e038","observation_id":"6bf268fe-dce3-4431-a494-a6b29375e738","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"What is your name?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:f9e8301bcd09925d4fdb7e875f5fa1d6204bb8f50faf977cd70c2c67525f2c74","observation_id":"012269f8-020d-468b-b005-c0a6a1d83043","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:a9848f0aaa051455d0888458dafcc6035f115510a7cf01af3a73fa301474700f","observation_id":"b5369f3b-b77a-4ece-9f10-4a68549a922b","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":"Let’s think step by step:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:7a96e8f5746138a9e1ca0c9d59dbee0f7ef040e3f2a7c53d1098c6ae68084b15","observation_id":"f6b2b7fc-9cea-4e6a-b92f-a9587294f77c","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6500.7400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:56:55.796120Z","title":"Background context","venue":null,"work_id":"289b0bbd-38cc-47bd-afcb-917acd43ab0d","year":2024},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:73c37d15b2bb26a34aa24e64ccb104ec4d79c9171cc068eb0068dded83b85e3c","observation_id":"6bdf4761-5190-47ae-8b80-568900afab58","resolution":{"observed_at":"2026-07-02T11:56:55.797618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:38:54.253057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:c0f099c702156abdf1a5a42953facf85b6a718791aabf7b7989220ef26510a45","observation_id":"3852970d-8099-4670-987b-2fe39f9d3c0e","resolution":{"observed_at":"2026-06-28T02:38:54.253057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5200.0010","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:56:55.798883Z","title":"same substrate","venue":null,"work_id":"d26d114b-5d1c-4fb0-9fb4-00c9ca923cfd","year":2025},"citing_paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:38:54.253057Z"},"links":{"citing_paper":"/paper/2606.05817"},"observation_digest":"sha256:53f2ac0a47c17300fce07bb73b22a4cb0fc647d45f0ec4586324e2622616f560","observation_id":"e5001223-b049-411a-bd73-813f558153f3","resolution":{"observed_at":"2026-07-02T11:56:55.800597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.05817","last_updated":"2026-06-04T07:58:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T22:17:31.200453Z","submitted_at":"2026-06-04T07:58:55Z","title":"Consistency Training Along the Transformer Stack"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2606.05817."}