{"as_of":"2026-08-13T13:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2c24750ba6264fc8cd8968258d11a46a01874d8bbf0e3e244e051930792c665","coverage":[{"denominator":115,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:21:05.570023Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04819/citation-record","integrity":"/paper/2607.04819/integrity","json":"/paper/2607.04819/citation-record.json","paper":"/paper/2607.04819"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:42e686a6dc43c73e9b40d0cce3760314e3e9df2a364e6c7ddaaabe8f232c7f64","observation_id":"52d1524e-802d-4e52-a694-89ef3fd1077f","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:7249ba10d4803c42d4eb0df559be9bc5433e7d965c72df66610d652b3dd4d919","observation_id":"e5c4ab33-630f-4731-b533-a7a5ba1d735b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01103","last_updated":"2025-06-21T15:54:27Z","snapshot_observed_at":"2026-08-09T10:35:33.740382Z","submitted_at":"2025-03-03T02:06:22Z","title":"Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01103","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2503.01103 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2503.01103","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:12b25782466619e71658b530837343db60fca94c736be40abecf96f96a8ad3b6","observation_id":"551606ef-9921-41a7-91d5-abb37e393e49","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2507.15897 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:404a48d04ec44fbe2ec7c6042dcdc4aa202d6ccca482ebe6b2b2cb7d46dae74c","observation_id":"85f14ac5-1c0a-4310-a2d5-6e8476e46a73","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2202.00512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:77504589449786eb70386804efe3e80531f2cd8c5435405f2f43c3cfeacd0e75","observation_id":"3b78a112-9207-4b31-a4aa-9b2e84e748e0","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:47e363ecee3c0a6efd17f7af5ed8f906ba4eb2a45408f9baad3efb67df92765a","observation_id":"54494c9d-9c89-4970-8ecb-d3a71784879a","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2509.24526 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:2eb10c8df18876579b193cb7a267697c8a406590bd9832edb18303a3176c61dd","observation_id":"4477dd2d-36bf-43d0-ad82-c560c7c6a31e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2511.23342 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:481d29304851242a439cb87f7d76447184b8d9be0b4cdadf15a1e521e560319d","observation_id":"d2eeb3ce-f270-4ee4-b65a-6731d0dc3609","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-11T19:20:11.648968Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2505.13447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:798292d4316f36a422204ab0f3632757c67e330076f5d631445a08d5158a9894","observation_id":"abed0e95-fadd-4fb2-9b14-807fdd998807","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07507","last_updated":"2025-06-03T00:03:07Z","snapshot_observed_at":"2026-08-13T01:20:52.151634Z","submitted_at":"2024-06-11T17:41:26Z","title":"Flow map matching with stochastic interpolants: A mathematical framework for consistency models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07507","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2406.07507 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2406.07507","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:831e2c06bbc647f099452a39400de34da3ee61aa7c1a72194e806705b30fa8c8","observation_id":"4b39a425-4f0b-4358-a237-b4e2fbf7be7f","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2506.17298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:ea474675a8a372e56de5cc3752c7d1de890a007d13d77b633617f9135107ba89","observation_id":"d01213aa-e802-4959-b182-b912e0ae6d82","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-08-13T09:36:05.994763Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2508.02193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:fdfc40e5d11bfa4bfbaa0c488c017241a3dc19d208f87c4eccd309a606995c80","observation_id":"20b726de-a635-4c9b-b3e8-7a1baa9feffe","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2502.09992 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e450a2734f911d0907a77349d450346c78ac107e2c148aa7c231b113bf9c1403","observation_id":"99c0f24d-421f-475e-a0c9-1331e60399f3","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2509.26488 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:27f93044f3c0f05960816bb80e68f07b1fca77629ab9e6d6917ced6d8c85e4c4","observation_id":"dc203fb6-5e50-4cd3-96d8-3a19794f51ba","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07804","last_updated":"2022-04-04T18:55:28Z","snapshot_observed_at":"2026-08-12T17:23:12.641861Z","submitted_at":"2021-12-15T00:09:38Z","title":"Tackling the Generative Learning Trilemma with Denoising Diffusion GANs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07804","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2112.07804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2112.07804","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:48700248c952539edf1e463c1929873e835be1d80becd2d7481c825f56344978","observation_id":"93ebe841-75ab-4681-b6e2-e8e12d7b3456","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2510.06303 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:ad35ac6e1515bd0571457e786622da6876ac6a5c86258610b0e99e2ab103bf3b","observation_id":"eedad5a1-7296-4051-bcfd-912f5f887fba","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2505.22618 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:f430b96a6ef8de39f49a0ae4b415faebcf2d887125d63cee149ff954cf026419","observation_id":"053c7971-7d1e-4ebe-afa4-09cb187848cc","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-08-03T16:40:35.231838Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14189","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2310.14189 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2310.14189","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:c6771f93d6430a9327c412d3b4d166b71a2b90dfa835887335e27bf111b35cba","observation_id":"bbe93430-dbbf-4632-86ac-bffbc59e8655","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21035","last_updated":"2025-02-06T20:26:24Z","snapshot_observed_at":"2026-08-12T22:13:46.678873Z","submitted_at":"2024-10-28T13:56:30Z","title":"Beyond Autoregression: Fast LLMs via Self-Distillation Through Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21035","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2410.21035 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2410.21035","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b9351ce7028cb240878a86f9661ba5ea69c7b62edc0c6f55dc14cfdb637cca02","observation_id":"1c6bdeff-f391-4feb-a16e-5c0487b1ee1b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"ACM computing surveys , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:9ee12cca9cac9049e2a131f712870432ddf31d6664218af29d7413ccd330b783","observation_id":"bcf309ff-7683-4b97-a418-93d1261588de","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:8975fbc58f723cdcbf0c66e5041955a4c4637c3ee07f2f1ebe6b91a237d12f30","observation_id":"9bdbd468-ca38-4ede-9b6b-b65a51eae30b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-12T04:36:09.039703Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2412.01152 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:6d63fa58d69752397cbaae1e24050cd7a71cba2b08c6af7705c92b033495cc61","observation_id":"b32fbf9f-afa9-4c10-916d-278015236b0d","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-08-13T05:22:59.274069Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2508.09192 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:037a317feb23258a9c65c175f039981f8a50149e40340c0ef6ff7a87d3a253de","observation_id":"d9044a0a-10c7-4999-8ba4-3666150c2e3c","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:7517430c2e0f9d2d9ebdf6c30ac781bdf0a5b7f688358444cf765c7a479680fe","observation_id":"1e8e035a-b71c-44be-82ad-2c7735d67ebe","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:9660e972f2fe45671eea7db4339c3cc2809937da42895daf82a45104c380692f","observation_id":"6d3c3dac-9fe3-424f-a168-d3f1561920f1","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:5aa4bbbff2ec371d4d50112382f2f0456405130a409d98615f9fad9956cf6318","observation_id":"cf2657ef-c39c-442c-9961-cca4f5c3de68","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:4993584872ad37e3f6771c49d914f1a8fb4b5e3271f7030353fda3db4da252e3","observation_id":"2e25b9aa-6d00-4789-8aae-9630a43e660e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-03T23:49:05.512328Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2503.09573 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:db7fc3164bfda3fb298bb5944a37dfa8083cc0d735f3da6a1e2d3fa09a11caaa","observation_id":"f16595ae-ec73-47dc-aa13-748c83fc176c","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21357","last_updated":"2025-03-07T04:28:45Z","snapshot_observed_at":"2026-08-12T22:13:34.650172Z","submitted_at":"2024-10-28T17:25:56Z","title":"Energy-Based Diffusion Language Models for Text Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21357","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2410.21357 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2410.21357","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b6e597ec8a4b23f632023c9d64681eb0f3ec1de96ce96afed7fd7d48b495ef73","observation_id":"5e3f22a4-6884-4aea-a629-13b35176706e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06949","last_updated":"2025-09-08T17:58:06Z","snapshot_observed_at":"2026-08-13T09:48:36.853401Z","submitted_at":"2025-09-08T17:58:06Z","title":"Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06949","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2509.06949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2509.06949","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:af890c1f588bf4c9c9d0a1613ebb15673c2c088f08a58276d2aa3e918207ecfc","observation_id":"0dbfbf5d-d8ae-4709-b6ff-7c4c11ad38b7","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2601.07568 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d47945f50641b2193166ffd083119510fdc0c791a3717606aaf77071332eb3ea","observation_id":"eae64aa9-aae0-423e-ba89-468622c4932e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10875","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2508.10875 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2508.10875","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:3fd68b385cccf28408f4714a26cdc659a8239fe40552572023ec28c1634fcfd5","observation_id":"70bf8572-b106-4ade-a5a4-fee9de6537cb","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2505.15781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:bb6695ea7d782682683d93af4178b1482344ac2c5e2b665873ca0bec3739c540","observation_id":"eef39733-e605-43c6-869d-308e4a8ef461","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2509.26328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:005133da235520ca9c72b9b4be36d3ac1517343f2ba37c72d3bc110a08e6c8d8","observation_id":"5d1f620c-8aa1-4af6-94fe-185cd10fa0dc","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-11T14:21:28.473155Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19720","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2504.19720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2504.19720","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b454f9f1400c499d19c0dd8b3a2fec667ce5dbfa3d27a0bd3c26b9562aa202c0","observation_id":"0d37bf6c-7e9a-48db-aa6a-3820733bd029","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:eb25675097c01a5754c5fefe7f3f94accc1cd96c66bb134560fb55dc48475749","observation_id":"75aafc03-6236-47f3-99e1-712c345fc2a4","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:668e60cf6b1738fa49ff6da5c7278ee1ed430b07b3505efb7499364d54895027","observation_id":"b187bb11-9bda-4f00-84c7-abb9b179843e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2508.15487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:454a7d9cc57b12bf5fb015e01e4dda9d29593c20ae9daa635129d4e907c73bb1","observation_id":"e78e37ae-163d-498a-af31-cfee8a9b2ade","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:969c7e948958b3b97a32dfa9eb1b60a3916fdf00b33e6f5ca383c7304a3e5fc6","observation_id":"65fbae3f-e410-436f-9565-4661be8a07eb","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:5ba1dad9e9d94384dfe5564964d244fe90ba4fc378b35621d43b52fa496e6880","observation_id":"8fda2b7f-d210-47e0-9957-8bbcccc742bf","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2505.21467 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:5d49a1d75aec5bddf4b0e30d2759a996d5853c318c310e00150bf05b468a5234","observation_id":"37e685fd-737c-4038-b043-5f642786e226","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06295","last_updated":"2026-06-06T06:01:00Z","snapshot_observed_at":"2026-08-10T10:24:52.944584Z","submitted_at":"2025-05-17T15:50:46Z","title":"dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06295","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2506.06295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2506.06295","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:251749dd8330fc8d062faa424eb87e1504e799be2c6110482472e6f0f1c4b4d4","observation_id":"31131f48-ed99-45f2-81d0-3675662c4a98","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2511.19269 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:c44bc92e8e5d50e6b13f3d490388294e816ae30bf0b58b3f08abfe805b226a18","observation_id":"312a68dc-23e5-44d4-829b-c7b4a92e3836","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2510.23606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:926830daa1d4972a9fa3f601d61007878e110ddc892b95b78e78c5c0f927802c","observation_id":"fcbc5e76-9fa0-4cec-81b1-7425a90ab503","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2511.19473 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d9df786ab3fc00842063cbedb05d48b14bc8ee079c907220a3a095180f66ad85","observation_id":"94401e64-02ce-40bb-be49-af1a680f36af","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Transactions of Mathematics and Its Applications , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:bf73a33c269da8f693cec60dfa92bc13003e31c0fdd83f3845adf28755fdad16","observation_id":"f1bc3185-1034-4067-8831-991bdda9f075","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:93188b164b0fccf8ae7c6a4bda098a96edfd5754dbe52b383c2c18c966dc8236","observation_id":"819081b3-c843-432c-9556-66089af00528","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:1b6339f2d98c5d74197cf3394d4e28087a45360577fef84040f2ee39df3769e9","observation_id":"5291c8f0-62ef-4899-9055-15dc4cfce557","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2209.03003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:4f5e721bf53383c39b6e365d59da2e15833b14bac07811a870b3958637abbf1f","observation_id":"6519def1-0e0b-4496-9e46-66179c50ff64","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:09a28917ef8d53b3d46b0f133ae5e331215880ed048cdc59f29f782b92e7b7cf","observation_id":"035c7b24-9d93-4f35-905f-18d452b0c9a7","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2511.19942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:5ab151e6693e69ddd24b7069b5c0ee01500b15b578907652ab6ded5eae418b01","observation_id":"3d8307ad-4112-49a0-88d4-c079d1ba21a5","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2510.08141 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:51f82466dff230afec56ee48d3b647fdde2ec00e5fb8ed90f97dedce88a7b549","observation_id":"98aad5a6-e863-4258-b271-dfca013fff2e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e236a082b88d1199ed4cc2cd54be6ed5dedc4c3a16b8f03f5878a18f02f1aa66","observation_id":"cf3d9675-6eda-4f6f-b078-254b8f561cf9","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b5184cab03f9c824c2de9d0f53ed026293af6c7988277f05dd4fca115c67fe29","observation_id":"3e16b004-0ad6-489e-a57b-dea2c3166154","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:ee73d008234229d0f3103632cd327933b8132b19895aea7eb107c6ab9304ad67","observation_id":"ca01beba-ed81-49d7-a30e-26cc7ba33837","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b8eab9cc717b2d8c655580b1bb5b4a47382ed69afd8b459e0913a9eae3b9c9ac","observation_id":"a6ed8c46-cfdb-422e-861e-a7f426749079","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:96b431341a2b8ba1dbef27122068f18af08bc5839fc701dda8cb022a8bf15974","observation_id":"682a9b6d-5286-4288-9715-a62df726380e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"2025 , publisher =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:0b84c538a2f66dc9277f1e3331b650dc745bd90a3473ea61030064e1f75a09fb","observation_id":"4805d07b-c016-478a-af08-8e19a901933d","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21254","last_updated":"2026-07-02T01:19:03Z","snapshot_observed_at":"2026-08-12T12:29:45.605284Z","submitted_at":"2026-04-23T03:46:14Z","title":"Hyperloop Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.21254","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2604.21254 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2604.21254","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:a153e2c539bd24051a62227ddbdccd8023f63c4f03b38b49d0ae140d4e18db72","observation_id":"022bb0e8-8c6e-41d4-9b15-b9e5a4ca6698","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d82e9100b62ff963377b5fba4fbe0b529529b02d6a82ffce14518b50b12fa182","observation_id":"ca3444cb-e8db-49ea-b458-38a8a3c8e171","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:6fef5c043759bcb73b81ec76a1070fb279bf0d7a464d6a1525198e7cdd1de10c","observation_id":"559a57bc-c599-4ed4-ac54-7880f277e423","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:ea9159a0d577939431959cc4f8eb8753937cb451b83bddafc41d15e9e444d7ad","observation_id":"6da85d43-a17b-4296-9a6e-64f6fa702fd6","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:613ae06dfd517445378a6ca878318dd70e288e90de34164c7d5ca263434a9fc9","observation_id":"d777fae1-fe4c-475d-9ff1-8fd8a21bd7bc","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2512.24880 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:8ac30ec84d9cee1959f354a67abd581b22424823baadfa2fa06862cad7aacbed","observation_id":"5a0cce4d-bc53-439c-a683-4db23f3db69b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:300f916c883237c1c2708d6dd87d29e35cd6e04ea9ea6979d90dcc5e36d48dd0","observation_id":"07651cfe-f102-44d0-80aa-aa8dba64dbef","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d1d19eef64bdeda3237581375161bc1dcc0218546f4419e3ed97495f06e3ebf7","observation_id":"0c6b7d30-70eb-4273-a269-18019dac99ed","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Synthesis of Parallel Algorithms , pages=","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e15e6282d8cbc9b447262d1df93c7a030182c4a6c7b6bbcf2fbc834ebbd611f0","observation_id":"c20a93ef-3768-482c-bc59-b155cb3cf22c","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:0be20606434422d6d65430382c6adafdc540665cdca4e09b5958ce00e915f34f","observation_id":"bcbdaec7-2e4a-4e08-bc69-e2d720822ce6","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:8daac00081e1c9db473760d6e1ebcf40cca7c41af29fa54794a431040b335b30","observation_id":"7c7a8dfc-3627-4ddb-8286-145c0f19972e","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-13T05:30:08.792367Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"2026 , archiveprefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:157b1107ed652e0144d0460e2c7675f366dc12567b973f0cdb6561699fdbac72","observation_id":"9485afba-2355-4535-b4ed-09cec240ec37","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Qwen2.5: A Party of Foundation Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d1a90793347ba4889a7ff12a8bfeed7f97ae51942b86a4eafa5bf652cccfbd1e","observation_id":"d559bc59-8b4d-4db9-badf-ff4ce300ec95","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2401.02385 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:13555aafdb51592b9516947ae2ff42562d8e09b3d1b5e8c5d6ccb50089d1cb46","observation_id":"e554cc22-8915-4a7e-aabb-1f350b67e665","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2503.19786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:29baa4ed23c42e34686dc0924ceb15ca78be3da25098bac7a87a3e84ce48c84d","observation_id":"a0b28d63-1df8-4612-bb10-51062813bd24","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-06T22:41:34.301841Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20639","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2506.20639 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2506.20639","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:46452d9bd48ae76b9b21924d09d75a249578074bd5c32048e6d9af119a09823c","observation_id":"03c7ef51-da16-42ce-89cb-f26fa37712c6","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:c0a08f9505dddf6d379e383794e7dd7c9781d2e65002561304873b643906ad53","observation_id":"9d5d1e0f-f9ab-4a50-a0f9-1b2248469c35","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:5f4c28a0b71d9f83375e17873ea5e4c1f794f02ab43ec3d32146704c4b49d081","observation_id":"17a261ed-59d2-4814-990f-f2c3ba7b5a8d","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b5f3a981e330740f6b83c2ca3437adb31d292f8f35313c6590f03ab830e337a7","observation_id":"ad749027-6ae7-4597-9ab4-cb58615adae9","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Applied numerical mathematics , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:3fc7579b834c0858e4734e0e41496a9f78814b2e7cd5f0e2f02ba4260d2514a3","observation_id":"c14fd185-f687-4191-96df-7987e7cf63ef","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:0160ed59a8fd52c66d3037eaefe55ee3b663894cc63564994d224f5b7f731a27","observation_id":"ce2d5d74-1514-496b-b7ce-4e7463060082","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"A stochastic estimator of the trace of the influence matrix for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:55dab45169154e6c473658cddadd0789336e7ee3c54d293bbd5533a58f3918ab","observation_id":"e9f3178d-3d5e-4c11-a347-07e08146b5fd","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:236ac1a291a2baa0712f176e309eeb195052f5d5490f894e27ee6b4cac8f490c","observation_id":"2df45172-1aab-4da4-8597-eceb22c054dc","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:601bb0d0bb1bf957780f3e9af960c96fc85e961821f3d601c0e47cd04bd361b6","observation_id":"49d7fd7a-b53f-4952-a55c-d7d23c9ddc72","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b7370d3fb3fdec8caf303ef1fd67077eae0c1575d6310813a40ccc8de3616e9b","observation_id":"e2f7caba-6640-4d95-942e-ad7f0e1bcd87","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:483d68fcde75e612ee0bb0500558142286f4db1f0350f98a2d33574be1659cc0","observation_id":"b9909efe-2023-4709-a4ad-bf8ae031f091","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Neurocomputing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:3da8298255c57dcd1f9ef5ba4c24e0374bc78832231bf17cb1fdbd6d2d52db9b","observation_id":"27ab3f1e-0e88-4309-87e0-a522c03cab12","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e69c7b3cea87cb775374d8bc906272c25476b2bbcb15a355f5e1b81ddc58d5e9","observation_id":"322817b4-0bd0-4771-8f0e-8b9594efdf1d","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:fd80457769cb45a020e05e10d357df4d5e11940e724dec13e705ed1c13f7b960","observation_id":"f026f153-3583-43d9-91cd-e9a23ed6e33b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:0adae244d8a579f680f42a94aeebd97b9d381c10506966f00be08ec2c1310f02","observation_id":"c5b625e8-b842-4ecb-b509-3eb61bf7411d","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:884f62aae8b4748fe46995ae98d804ff2a6cdee63c12f6d0196c051ed9d87e77","observation_id":"4b73d7b2-04ff-4a4f-bf3c-fe2f1d39eb61","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:c989f331ce7a3f1a270634775f78d93df70dcbc35ec33517e61cc047601a78df","observation_id":"a7c9bbdc-c41a-48e5-95a0-4ec18b706d7b","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:02a45184506bcce1bf05c91e4a04d851754e1f505838d95606c598fed99d7d5e","observation_id":"206b0c34-6780-4ed7-914e-658ec2fff06f","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-10T21:52:49.568983Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2302.01318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:27b1f4c407612129f340c146a63c7326419a0ff22ce6f4186bdbe42551deb6ce","observation_id":"1f8387b4-4976-4383-a903-ec60dd23ad86","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:031f150dca3a38823296eee0f8d266f4a27f1d83e4aeb41d20c7434447b8bf24","observation_id":"5bb0fe61-795c-40ff-b04c-1caaae1614b2","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:c704bc21a89f5d0bd63dd731d9a2dbfdb3c2ead5af9f96edbe34633eb03d4273","observation_id":"c4b6812a-6069-4933-a7c5-444a3e03d686","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:58eb6e1cfc850110603dea535541085082c8f61fbb6137a27e4c25d7d07d3e33","observation_id":"6249804b-86ae-4f63-b5e7-5c881830c5fd","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:fd321af44aa30c82187172e5e84440ff49a8a2c2f508b89b2b19fd1990592e00","observation_id":"51a6b5d4-d6cd-460c-b7d4-6a0dbf91678f","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:d11b3165376913ef618e0e293d1d38ec2970cbbc27112b3dbaf63f65b738f99f","observation_id":"bf380465-4c6a-4475-9c1a-4e06663f8c42","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:474ed3676f506f9e9267475ea32ac2b80a80de78640db8446a4d2523988bc4dd","observation_id":"ac6ffe96-51a7-40ff-8eca-b67ad5717c26","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:70aa5886d7f548589034013fcbf0e3d03953bf93f386779b33578731b96fa382","observation_id":"c75cb7cb-8971-479d-9e39-408163118fe9","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:e7232101a5b299880bee787c15bf6eba7df201114ece967ba51e404fc40b37e0","observation_id":"7f0709cb-2c2a-48e5-9424-699285957209","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T14:30:06.169747Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":115},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 115 outbound references and 0 inbound Pith citation observations for arXiv:2607.04819."}