{"as_of":"2026-08-14T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9385cedbbd3ad3289bcb678574942538d3402d1f54ee822de9f5a842058212f1","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:06:50.914516Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19691/citation-record","integrity":"/paper/2607.19691/integrity","json":"/paper/2607.19691/citation-record.json","paper":"/paper/2607.19691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.361744Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.361744Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:573a0f92cef2b100c0568470f7ea74822724bbe8c9b09807e5311ec4cbb7bb0d","observation_id":"98f4168a-08d2-40ab-a803-9f9bc24e6bf7","resolution":{"observed_at":"2026-08-01T12:06:50.361744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.476143Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.476143Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:725ea3556f8878e63c79dad7c1d92985e0eb452eeefe5ebbf4e17c2c1fa26be5","observation_id":"4669b744-db50-4280-aa4f-4bbe32799149","resolution":{"observed_at":"2026-08-01T12:06:50.476143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.em","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:08:55.992604Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"75d53697-5c47-4442-b25d-614597815729","year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.803213Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:01803e43db914fd83e1bb70763692fcc6d1c46fe06809e1ca4d47673ddf33205","observation_id":"467ec1b5-6a25-403e-9ad3-fc0fe407a96c","resolution":{"observed_at":"2026-08-01T12:08:56.045800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.823111Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.823111Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:da3a4a43c27af9dddc0df6347cd440793ca9acc3472be3ecfa30e2341f0234f2","observation_id":"edf53b48-3f1e-4422-8ff2-7182b7f66e0c","resolution":{"observed_at":"2026-08-01T12:06:50.823111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T12:06:50.827423Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.827423Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:3d8074a75fee700120753d35aabb28d9e21744a4e91526b9dea759df08c8fec3","observation_id":"a7fc9aec-8768-4a08-8677-9b45bf488850","resolution":{"observed_at":"2026-08-01T12:06:50.827423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-13T08:32:24.716266Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-01T12:06:50.831758Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.831758Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:8e159f45bb8bf68d9e3e74eb34c460217fd08d21757ec0f5c1f70789c7a0d25f","observation_id":"e7eeed5c-9805-4e0c-ba32-16f4e5399aac","resolution":{"observed_at":"2026-08-01T12:06:50.831758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-01T12:06:50.836674Z","title":"A survey of reinforcement learning for large reasoning models.arXiv preprint arXiv:2509.08827, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.836674Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:3fc8e7c87689707a108504226d08b035678f342aa0b6fbc3d7a81df9cb843319","observation_id":"4bcb7dc4-134a-4bc5-86fc-795749305c2f","resolution":{"observed_at":"2026-08-01T12:06:50.836674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-01T12:06:50.840892Z","title":"Stop overthinking: A survey on efficient reasoning for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.840892Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:adc0bc26d39190f8a084d79a0995ccb1ff069f512d17bb23c1e850df70fea94b","observation_id":"39689129-2aea-4c63-9fad-dc9391898c7a","resolution":{"observed_at":"2026-08-01T12:06:50.840892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.845376Z","title":"Regular: Variational latent reasoning guided by rendered chain-of-thought, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.845376Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:7225dd8b791ffaecbe5c23ac32226269b6354a0eb1ec7c967cd6e731b99d8dc9","observation_id":"5b173eeb-3447-47df-a150-207af4175eb8","resolution":{"observed_at":"2026-08-01T12:06:50.845376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.849190Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.849190Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:b36b9ff2affb66f0ed25e69b877dd52d562c49a529f7da022ae85a37069ed4d2","observation_id":"3b060503-f3a0-491b-94d5-5139562e7341","resolution":{"observed_at":"2026-08-01T12:06:50.849190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.853257Z","title":"Reasoning beyond language: A comprehensive survey on latent chain-of-thought reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.853257Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:633e3310e5b3641dd06b6930bfcf8115ada71bc5f973a7b09d2a1c0368736726","observation_id":"f126d0d4-4ffc-4bda-a691-984cd45f8248","resolution":{"observed_at":"2026-08-01T12:06:50.853257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.861366Z","title":"CODI:Compressingchain-of-thought into continuous space via self-distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.861366Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:a10b31de0e31448dc97cf6bcf1f4ac4992ec6c727ce18890d64a2497d2be49f4","observation_id":"c477984f-b936-4c53-9ec0-ccd6bf7570b9","resolution":{"observed_at":"2026-08-01T12:06:50.861366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.865291Z","title":"Think silently, think fast: Dynamic latent compression of LLM reasoning chains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.865291Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:25b2657d7dcae6d9a4b6c6247588edff9395d37eb4134397438558ca0776f9af","observation_id":"902f68a6-744e-41ed-ac7f-8260f49c8a5f","resolution":{"observed_at":"2026-08-01T12:06:50.865291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.869443Z","title":"Sim-cot: Supervised implicit chain-of-thought, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.869443Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:da61439b260b18f3bfb78c834a6c7233359bdbdb5481ff95295bd1c3fcdea151","observation_id":"c99e7411-812c-4ccd-8641-49a27d1415f3","resolution":{"observed_at":"2026-08-01T12:06:50.869443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14750","last_updated":"2026-05-31T05:30:22Z","snapshot_observed_at":"2026-08-03T09:09:48.759756Z","submitted_at":"2026-01-21T08:09:25Z","title":"Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14750","snapshot_observed_at":"2026-08-01T12:06:50.873406Z","title":"Render-of-thought: Rendering textual chain-of-thought as images for visual latent reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.873406Z"},"links":{"cited_paper":"/paper/2601.14750","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:19ab54c40f2a311424b5972981ec43b75b80ffab983f167ac9fe36e94bd3deef","observation_id":"28f217ae-550c-4d4c-b0d8-b0640bc50b21","resolution":{"observed_at":"2026-08-01T12:06:50.873406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-01T12:06:50.877576Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.877576Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:1b9e386817158e7acec8e4875d23644c179463401eaee9d3736b6319cb5b14dc","observation_id":"c0354322-4a2e-4126-8a39-5bdf71165560","resolution":{"observed_at":"2026-08-01T12:06:50.877576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.881769Z","title":"La, Duy M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.881769Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:417b886362b1deef97ad491012a95e8302c35ce08df357c4ed54de4a1025def3","observation_id":"5d44ac5f-3876-4dc1-b36b-94cd2c1073d3","resolution":{"observed_at":"2026-08-01T12:06:50.881769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.885793Z","title":"DART:Distillingautoregressivereasoning to silent thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.885793Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:4ddb44417bf9cd0aa12181af36f875a6d1ce7128d801eb2943257817d422d11f","observation_id":"5a9b0b3f-9d17-43c7-8244-7b4bc978dc7b","resolution":{"observed_at":"2026-08-01T12:06:50.885793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.889733Z","title":"LLM latent reasoning as chain of superposition, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.889733Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:350ae93c2ef5ae9c55c992b017f3c4994e3c3703213c9725eddedaccc0837a93","observation_id":"faa32a5e-dd82-4e2d-b379-0d78c3276fdd","resolution":{"observed_at":"2026-08-01T12:06:50.889733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.893604Z","title":"Parallel test-time scaling for latent reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.893604Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:c984f135a7680ea78bb6d9f5030123135e755c445f5516973be3679f41da3f07","observation_id":"16e548dc-f841-48d7-bf2a-7dd7995c63e4","resolution":{"observed_at":"2026-08-01T12:06:50.893604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T12:06:50.897640Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.897640Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:c9e94070ee8d59fdf65cca09ed62886e367282028597ca80e288161a9360b282","observation_id":"08c6db03-c809-498e-a49a-3ea8b53bf8a3","resolution":{"observed_at":"2026-08-01T12:06:50.897640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-07T22:35:14.747287Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17218","snapshot_observed_at":"2026-08-01T12:06:50.901959Z","title":"Effective reinforcement learning for reasoning in language models.arXiv preprint arXiv:2505.17218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.901959Z"},"links":{"cited_paper":"/paper/2505.17218","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:09b41a6f11d37f285d3b11baef3773911de7a5914ac38d0650c9a7e32461430b","observation_id":"c7e51b63-acdb-44de-a9fd-2741712cc433","resolution":{"observed_at":"2026-08-01T12:06:50.901959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17892","last_updated":"2026-05-11T03:02:30Z","snapshot_observed_at":"2026-08-12T22:16:31.802071Z","submitted_at":"2026-04-20T07:05:12Z","title":"LEPO: Latent Reasoning Policy Optimization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17892","snapshot_observed_at":"2026-08-01T12:06:50.905951Z","title":"LEPO: Latent reasoning policy optimization for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.905951Z"},"links":{"cited_paper":"/paper/2604.17892","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:88f17ac3160d97673ae62cb81763993e2e07538c0ce65dd269005c40634b09ad","observation_id":"d6cfab06-5b62-478a-a928-aa918abdba56","resolution":{"observed_at":"2026-08-01T12:06:50.905951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27998","last_updated":"2026-04-30T15:23:40Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:23:40Z","title":"Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27998","snapshot_observed_at":"2026-08-01T12:06:50.910188Z","title":"Latent- GRPO: Group relative policy optimization for latent reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.910188Z"},"links":{"cited_paper":"/paper/2604.27998","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:0c41273bee8c998e78f31c8a81abbbd0b842d578c4a2fbdc3eb47f0df8459f4a","observation_id":"19ceb98c-c811-408f-bd69-3655c821862a","resolution":{"observed_at":"2026-08-01T12:06:50.910188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15778","last_updated":"2025-05-21T17:29:15Z","snapshot_observed_at":"2026-08-10T11:39:20.508638Z","submitted_at":"2025-05-21T17:29:15Z","title":"Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15778","snapshot_observed_at":"2026-08-01T12:06:50.914516Z","title":"Soft thinking: Unlocking the reasoning potential of LLMs in continuous concept space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.914516Z"},"links":{"cited_paper":"/paper/2505.15778","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:0302baad406cd0fdd3c5147237f72a9f82c1b1d4bf77f1a59292f8aedcb267e3","observation_id":"741454f6-b722-4f12-b3b7-fe3fae7eeff5","resolution":{"observed_at":"2026-08-01T12:06:50.914516Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.642661Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.642661Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:8ad2081e4235a51200d142127996a82eb1311fb100096494ab5364dcf9b23150","observation_id":"61fd0556-9739-4f26-b70b-77070b783ae1","resolution":{"observed_at":"2026-08-01T12:06:50.642661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:06:50.857302Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.857302Z"},"links":{"citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:a7c8e9f60271fc089440ae24ecd0afcaaeb6bad7944dca15dacd0f163524dce5","observation_id":"ff319080-1438-4872-8a44-b5cbabfddb53","resolution":{"observed_at":"2026-08-01T12:06:50.857302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.19691."}