{"as_of":"2026-08-15T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:019cde9bcdb9733c307f169530c4a5bddb760f209f3f17094006e33b767ab08f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:52:03.527092Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19331/citation-record","integrity":"/paper/2607.19331/integrity","json":"/paper/2607.19331/citation-record.json","paper":"/paper/2607.19331"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:58.381326Z","title":"The path not taken: Rlvr provably learns off the principals.arXiv preprint arXiv:2511.08567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.381326Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:f7d5c9023c95ad9491ba7fe80d7fd61d4d1facd547b5e345744d9c59108d1a9d","observation_id":"9fb79cc2-c404-47a3-b915-cf07e0226282","resolution":{"observed_at":"2026-08-01T12:51:58.381326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:58.456075Z","title":"Grok: Ai assistant, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.456075Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:7f0f71072be96ff69da6205265f18e6dc438283be6843483275833aa99ee6c81","observation_id":"2d155ade-fccd-44a4-a9f3-e6e4bf9c828d","resolution":{"observed_at":"2026-08-01T12:51:58.456075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:58.547495Z","title":"The next frontier of data training: Rl environments, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.547495Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:0ca3f192d6a37c6d07d7634b2379c8e5df7f46ebb17f1438fab1ce23b94c0b59","observation_id":"109c1178-5c5a-4d7c-8532-d21f95ce3024","resolution":{"observed_at":"2026-08-01T12:51:58.547495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T12:51:58.615937Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.615937Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:c5575fdcecdb6fd98a8b42b5713bff6c51c025d1d6d557df9733edbf87afafaf","observation_id":"8c496e67-3f2d-42a3-88c9-d35d896f1301","resolution":{"observed_at":"2026-08-01T12:51:58.615937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T12:51:58.724095Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.724095Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:6ae9d6324db7c40b136dd474a6f6f688fadfbfff2453d41494260653576988b1","observation_id":"e6b2143b-7ea9-4528-98d3-66cbad8e05e9","resolution":{"observed_at":"2026-08-01T12:51:58.724095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-01T12:51:58.848244Z","title":"Reinforce++: Stabilizing critic-free policy optimization with global advantage normalization.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.848244Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:5a6e6f73188b98b77e8d42ad1ed038424282edc469ac00dde1a2613aac6c398e","observation_id":"f5411b60-45a5-48a4-a6fb-6f5e5c341293","resolution":{"observed_at":"2026-08-01T12:51:58.848244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:58.987971Z","title":"Maximum likelihood reinforce- ment learning.arXiv preprint arXiv:2602.02710, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:58.987971Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:387f490fe9665b7ef6ad0e3e5cd900d55cf5833c8b79ca8ac96b628f0afd4f2b","observation_id":"ee2d3756-c0ec-4833-b6b9-811ffea78cc5","resolution":{"observed_at":"2026-08-01T12:51:58.987971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.150161Z","title":"slime: An llm post-training framework for rl scaling.https://github.com/THUDM/slime, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.150161Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:8847a86d6d74da602f65d77c0c9decdecca34dd4172a5e196966be7d1005f022","observation_id":"7028889a-d730-47ee-a0c6-7e4a7169f6c0","resolution":{"observed_at":"2026-08-01T12:51:59.150161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.263916Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.263916Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:10b9d453ad6640c2ed92383765f2b4b9b95819b9a559d75f2ef08b975c942816","observation_id":"31f01d3d-e689-4049-8649-e893b182bb2a","resolution":{"observed_at":"2026-08-01T12:51:59.263916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.385713Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.385713Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:c316a09ba79ce273058da6b0bb45c8f9bd27b6a9e775ea657fb635fb66910e04","observation_id":"6b11721a-81b1-4a91-8b56-0e64c293fca5","resolution":{"observed_at":"2026-08-01T12:51:59.385713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-01T12:51:59.490848Z","title":"Muon is scalable for llm training.arXiv preprint arXiv:2502.16982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.490848Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:fda6af384b6951a93d54153ef4d417e56acba2cd406e39bbad0c2fb207e67d4e","observation_id":"0c3ccaa9-27b3-4a29-aebb-400c1592ea16","resolution":{"observed_at":"2026-08-01T12:51:59.490848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.572851Z","title":"Apollo: Sgd-like memory, adamw-level performance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.572851Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:e83d4e7e248ffd5cac2559f95df0fed9a1af2baf6d2c37927abba9ee2e4c5cc4","observation_id":"52816f9f-79f5-4533-a45c-f73a39cf46d7","resolution":{"observed_at":"2026-08-01T12:51:59.572851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-14T20:00:15.443626Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-01T12:51:59.644271Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.644271Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:029427857679dbcfe4b8613013718084553428ef09d6b8a0722ff51678ba41d9","observation_id":"3f7eb4a2-f1b8-49dd-b36e-69ef81faf30f","resolution":{"observed_at":"2026-08-01T12:51:59.644271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-12T16:06:41.904690Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-01T12:51:59.749347Z","title":"Rl’s razor: Why online reinforcement learning forgets less.arXiv preprint arXiv:2509.04259, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.749347Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:0286c4dc951a9fd9b418a19d8d7ae78b3756215a4ccfc88afbe17c4e959b4dca","observation_id":"9458d855-f1b3-4ecc-afb2-a657f835b91e","resolution":{"observed_at":"2026-08-01T12:51:59.749347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.860730Z","title":"Reinforcement learning finetunes small subnetworks in large language models.arXiv preprint arXiv:2505.11711, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.860730Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:45f8937d290365e168da2a96fddb6a2f4b378ab8c65695181b60c92f35e700dd","observation_id":"119f322d-a943-40f9-943d-fad6988d6e7d","resolution":{"observed_at":"2026-08-01T12:51:59.860730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:51:59.927168Z","title":"On-policy distillation.Thinking Machines Lab: Connec- tionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.927168Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:e57c2433e5b5d3f3ebbbeb3e7f7dfcf3e067c1956bfd491f24f11f251267e098","observation_id":"0780e322-c512-4258-ab23-4810c06b97a4","resolution":{"observed_at":"2026-08-01T12:51:59.927168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T12:52:00.004361Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.004361Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:5e5d8a7de2d6fdfdcf469423896f8d38f9bde1535f91e07eeab5ac653b661fb4","observation_id":"9e76d293-0dad-4615-b52f-2ae0ba5f85be","resolution":{"observed_at":"2026-08-01T12:52:00.004361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.067015Z","title":"The invisible leash: Why rlvr may or may not escape its origin.arXiv preprint arXiv:2507.14843, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.067015Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:2c8b9655880e44c53ac35d4590adb2a6f268dbdf18a2fda7edb41f7a67ba18d5","observation_id":"bacfbee4-d40a-47c5-8201-102e767cf400","resolution":{"observed_at":"2026-08-01T12:52:00.067015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-01T12:52:00.138146Z","title":"Prorl:Prolongedreinforcementlearningexpandsreasoningboundariesinlargelanguagemodels","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.138146Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:2f8f55dc1777fc49e99242deb03449a26adf0f32d0dc7fcaa6076e862f3ce249","observation_id":"486c41ab-4829-414a-898a-1eb672dc75eb","resolution":{"observed_at":"2026-08-01T12:52:00.138146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.283718Z","title":"Brorl: Scaling reinforcement learning via broadened exploration.arXiv preprint arXiv:2510.01180, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.283718Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:7bc626354e6d718d5812e93dd37605bb233a51f3dd3f20a8325bf2ef3cfbf4a6","observation_id":"38134479-33df-4628-9f80-57bffd7229d1","resolution":{"observed_at":"2026-08-01T12:52:00.283718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-15T03:41:08.751572Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13998","snapshot_observed_at":"2026-08-01T12:52:00.380279Z","title":"Embodied-r1: Reinforced embodied reasoning for general robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.380279Z"},"links":{"cited_paper":"/paper/2508.13998","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:50b98aad4329aad4743d0af2f0ed0782df2b0a108a20577e825bc6c673f605b5","observation_id":"79f025dc-e300-41aa-9d6c-67e0ed74d483","resolution":{"observed_at":"2026-08-01T12:52:00.380279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.445811Z","title":"Dion: Distributed orthonormalized updates.arXiv preprint arXiv:2504.05295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.445811Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:d56070bc39e7f028e2b39c723d3af2501fffc219b43b2f8a4531e04015b0e0d8","observation_id":"af66c004-4399-4349-bfd9-b33bfccb439d","resolution":{"observed_at":"2026-08-01T12:52:00.445811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.529969Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.529969Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:687f4f7e58ccb31d5eb6c91f930332eb7502a45a38b2717813d85d5ce8ac8b6f","observation_id":"2609e633-3506-4d5d-90b5-15426bcbe039","resolution":{"observed_at":"2026-08-01T12:52:00.529969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.627803Z","title":"Co-evolving llm coder and unit tester via reinforcement learning.arXiv preprint arXiv:2506.03136, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.627803Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:1e902162c40ea17c7b17593584a2509e95557d2f1c4b270fca584caffaf9c135","observation_id":"76ef3918-82ce-4323-a643-fbef981af767","resolution":{"observed_at":"2026-08-01T12:52:00.627803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-01T12:52:00.702419Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.702419Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:846bfc37d73aadc21446d84f21d704932d3bc4ea175ccf3a80dc0fb3cbca3584","observation_id":"47e2f468-b945-49e0-a61a-5378f017a1f6","resolution":{"observed_at":"2026-08-01T12:52:00.702419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02259","snapshot_observed_at":"2026-08-01T12:52:00.784884Z","title":"Memagent: Reshaping long-context llm with multi-conv rl-based memory agent.arXiv preprint arXiv:2507.02259, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.784884Z"},"links":{"cited_paper":"/paper/2507.02259","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:8f401328a3b9fb88c07c7643f4da0d9477a87bf539b340eee73707a5d083fa05","observation_id":"5077b1a6-2bb5-4b3b-b98c-d3dd32cf2384","resolution":{"observed_at":"2026-08-01T12:52:00.784884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-01T12:52:00.879258Z","title":"Editing models with task arithmetic.arXiv preprint arXiv:2212.04089, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.879258Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:b64ad51ed99d31bc0a06746a13bf0953745c6908cd7c80b2503f81491ba34edc","observation_id":"a50e5f76-aae4-422d-b6ae-c3b0d1a79069","resolution":{"observed_at":"2026-08-01T12:52:00.879258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:00.979104Z","title":"Ties-merging: Resolving interference when merging models.Advances in neural information processing systems, 36:7093–7115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.979104Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:66c52f321e3e4009ba2a7008678afcaeee16269d2c544a70ac1f05eef8159b18","observation_id":"be3ca050-58fa-49a9-88f8-e3dfa851b4e1","resolution":{"observed_at":"2026-08-01T12:52:00.979104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:01.188253Z","title":"Task singular vectors: Reducing task interference in model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:01.188253Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:232e471ce4ba50a20a41603ba0fb9f57b7dc817f95ea08ed23011bbeaa5b2a88","observation_id":"9b3ef784-c894-4896-9559-8102ca1605ff","resolution":{"observed_at":"2026-08-01T12:52:01.188253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:01.359422Z","title":"Behavior knowledge merge in reinforced agentic models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:01.359422Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:32380d9fa382a8250f0734a1c31065abfb27b3c525cea50f2e1ff0144c68878f","observation_id":"e2453583-a213-4771-b9ea-2ec7471e6c20","resolution":{"observed_at":"2026-08-01T12:52:01.359422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:01.568383Z","title":"Orthogonal model merging.arXiv preprint arXiv:2602.05943, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:01.568383Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:5f908e8d8ba27db9316ce97639aff2656c08a06557554f896b4f242eb876f626","observation_id":"4a69c3de-09a4-47c5-904d-dbc4404c5eab","resolution":{"observed_at":"2026-08-01T12:52:01.568383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-08-15T14:36:41.242147Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.06062","snapshot_observed_at":"2026-08-01T12:52:01.770385Z","title":"Aspo: Asymmetric importance sampling policy optimization.arXiv preprint arXiv:2510.06062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:01.770385Z"},"links":{"cited_paper":"/paper/2510.06062","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:81b92f51db7675a77c46ff762af4cb74b5a298b42317dcd734f9f84f65550d62","observation_id":"089bb966-f1d1-43a3-9cb9-6e6e94077479","resolution":{"observed_at":"2026-08-01T12:52:01.770385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:01.995877Z","title":"Justrl: Scaling a 1.5 b llm with a simple rl recipe","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:01.995877Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:cb7df1fab339fd3fe6c7671d55b7d74f2ee8b162498a2312a10aa6450fbef235","observation_id":"a5626877-54be-43a9-b64e-65c5bfc77123","resolution":{"observed_at":"2026-08-01T12:52:01.995877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:02.184137Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.184137Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:e904a9bcc363b260eac83a6bc58378e0e2a743e070da0111eb34607f30e5fa1b","observation_id":"3acdd35c-cce4-4afc-9028-589217449f8d","resolution":{"observed_at":"2026-08-01T12:52:02.184137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:02.283198Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.283198Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:1cb11e440c12939d997fa7fe48fea8bae499b1981f24d622cf1a2d5cbdfc1f22","observation_id":"672af4c9-5981-4490-ac04-e3502bb241ac","resolution":{"observed_at":"2026-08-01T12:52:02.283198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:02.396885Z","title":"Modular manifolds.Thinking Machines Lab: Connectionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.396885Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:60fc7420876b9551a12c80f41fb3a540511b00d0433f10f0d4afba985ec1824f","observation_id":"9ae03c82-301e-4cb1-acf4-0f022b6fed8f","resolution":{"observed_at":"2026-08-01T12:52:02.396885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:02.495025Z","title":"Reparameterized llm training via orthogonal equivalence transformation.Advances in Neural Information Processing Systems, 38:140775–140821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.495025Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:ac903846ca37de578651be816fd824cf2e1e6c9265e304c67a2f9a2dd5b909f2","observation_id":"756f4711-e414-4ca6-bac4-8e5ae5ad7934","resolution":{"observed_at":"2026-08-01T12:52:02.495025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05500","last_updated":"2026-06-06T09:18:23Z","snapshot_observed_at":"2026-08-07T14:22:42.629214Z","submitted_at":"2026-03-05T18:59:23Z","title":"POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05500","snapshot_observed_at":"2026-08-01T12:52:02.679503Z","title":"Poet-x: Memory-efficient llm training by scaling orthogonal transformation.arXiv preprint arXiv:2603.05500, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.679503Z"},"links":{"cited_paper":"/paper/2603.05500","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:9b6c55689d1867b252d394ec68e0301e9c3ce7efce4cc0fb82b53e9c02768311","observation_id":"bc02de12-8664-4b8f-9ce7-dc09e30ff14e","resolution":{"observed_at":"2026-08-01T12:52:02.679503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13952","last_updated":"2024-11-04T03:35:19Z","snapshot_observed_at":"2026-08-13T00:01:52.407882Z","submitted_at":"2024-05-22T19:36:55Z","title":"Spectral Adapter: Fine-Tuning in Spectral Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13952","snapshot_observed_at":"2026-08-01T12:52:02.857528Z","title":"Spectral adapter: Fine-tuning in spectral space.arXiv preprint arXiv:2405.13952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.857528Z"},"links":{"cited_paper":"/paper/2405.13952","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:50cba016a6268cebb0917c1271fb4536cd3dfde5499d20e44f0df6da39215174","observation_id":"1e2b093c-30a2-4fdb-bee3-d02a1923b038","resolution":{"observed_at":"2026-08-01T12:52:02.857528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:02.991752Z","title":"Stella: Subspace learning in low-rank adaptation using stiefel manifold.Advances in Neural Information Processing Systems, 38:75066–75092, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:02.991752Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:8d615fabc8e305acdaf0ba94752ff3aac7d636525df9501eb9f643cd56448430","observation_id":"7754d884-2a61-488c-8e1c-9b72b9aab03c","resolution":{"observed_at":"2026-08-01T12:52:02.991752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12492","last_updated":"2026-05-12T17:59:34Z","snapshot_observed_at":"2026-08-11T05:29:18.460886Z","submitted_at":"2026-05-12T17:59:34Z","title":"Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12492","snapshot_observed_at":"2026-08-01T12:52:03.085095Z","title":"Pion: A spectrum-preserving optimizer via orthogonal equivalence transformation.arXiv preprint arXiv:2605.12492, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:03.085095Z"},"links":{"cited_paper":"/paper/2605.12492","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:fceaf4d7ce2451ef646a6198ba2def5a053bb0800de696528f2977d67253c5ea","observation_id":"c0665ddc-670f-4eb3-8722-a88110719496","resolution":{"observed_at":"2026-08-01T12:52:03.085095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T12:52:03.224941Z","title":"Lora without regret.Thinking Machines Lab: Connectionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:03.224941Z"},"links":{"citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:112d86a6a00fe4f59afa28a1e4d56295e84d1e7849fcee3f7cfc6f125dfd6867","observation_id":"94062c08-7628-4134-afc7-7e51bdb34c4d","resolution":{"observed_at":"2026-08-01T12:52:03.224941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-14T07:39:12.121905Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15778","snapshot_observed_at":"2026-08-01T12:52:03.418484Z","title":"Stabilizing knowledge, promoting reasoning: Dual-token constraints for rlvr.arXiv preprint arXiv:2507.15778, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:03.418484Z"},"links":{"cited_paper":"/paper/2507.15778","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:34d30508b04abe6cc88f6446bf4a91e95b43a26b7532c256de1ff35557ed5006","observation_id":"dd033691-a5f8-4659-b63a-036f71bf2c21","resolution":{"observed_at":"2026-08-01T12:52:03.418484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-01T12:52:03.527092Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:03.527092Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:c9cbdb2b2ac8ed8e4e8efbd77b1eb33766921a790eada56d7a4f27b0ce8cea2c","observation_id":"ca4803f1-3782-4a8a-9bec-5f89986cd66a","resolution":{"observed_at":"2026-08-01T12:52:03.527092Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2607.19331."}