{"as_of":"2026-07-22T06:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40fab5279a238855efad56305508f648e41a2f3cabbd89a63ffab9d191c1a234","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:55:33.276019Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03021/citation-record","integrity":"/paper/2606.03021/integrity","json":"/paper/2606.03021/citation-record.json","paper":"/paper/2606.03021"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-10T14:47:14.590391Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:ecd491227ea4ccf764906cb0eb0263fc3129c8e03aa9b67a667977ba2b537336","observation_id":"a5289c82-b752-4455-ba86-ca4d69de0dcf","resolution":{"observed_at":"2026-07-02T02:26:26.885472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:43.280911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:43.280911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:e2333f72d49f50665b3f1e72babc0d508922fc419b141d3881f463aaced5125b","observation_id":"6138a529-2a89-436b-b052-7b601b501ef0","resolution":{"observed_at":"2026-07-02T02:26:26.899220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:1c8c73555b057384cf0154394c83cc3260f198a48044b58b76425a7ad9335661","observation_id":"6865d765-3e14-4e4c-ac25-15bbf44007fa","resolution":{"observed_at":"2026-07-02T02:26:26.888167Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:30e48afe8a945c48d4fc5de716b84bca4255ab4c03c5e884e67f0143858139ef","observation_id":"b467ea7f-5194-4989-a937-87073731b48d","resolution":{"observed_at":"2026-07-02T02:26:26.893490Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:8f1b7ff9584d06916b3accbd13055309c60e21ffdac3fe99276039df95eb781e","observation_id":"3cf3b544-01bf-4f2f-b598-1c80e09bdc7c","resolution":{"observed_at":"2026-07-02T02:26:26.896086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6993.2864","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:26:26.889374Z","title":"Yes” as a measure of the similarity between the two candi- date solutions. As shown by “HDPO (LLM-Div)","venue":null,"work_id":"2181f5b0-7f0b-4f3e-822d-a4701a24b17d","year":2024},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:3eeec7f7d1f97f4a3c60ccf0bca1b45faa5b7bde28d6712c12fd27c7deb8b9e3","observation_id":"0331e4cf-4cf3-454b-8d03-e71e6c1da721","resolution":{"observed_at":"2026-07-02T02:26:26.890915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:2fb2b4f1a40631de80f4d0083807918039b67c0b81a47bb398d3a70c48d4a1b8","observation_id":"92127c55-c70b-4017-b83b-83b0d2a6cadc","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"ex- plore–evaluate–select","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:3ec05f0a31f0f93c5a8e198cce670c3eff7398150b49dfc40410ff9d02e5adf4","observation_id":"12fcd6b0-9292-4ae0-b0a4-1c3ce572e676","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"It should only elaborate on the high-level strategies and concepts, without going into specific calculations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:db2f076d29f22bb970c6fef9c739a289562b6c95f27e62043a476dcfad88d2d8","observation_id":"9e8afd8b-3c22-4c2d-b26a-6d3b4782a808","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:cd8501e68d35abd2a79fb13697e1e93651edd97ee73ce4ccb80a7fad51fb97e7","observation_id":"3e8484ce-4d34-4fbd-8f99-ea4358780e9c","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:d201c5366093f76efd78f8b573df8e9c3cf6b2ca578e1584211e23c5e7e3800c","observation_id":"c0722538-8053-4b5b-b6a5-23c426423162","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"[1]”, “[2]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:8286d89a725598a6f80b4b48188b70a432a47d23e2ae8f048b28d0654387ee94","observation_id":"95241bac-5176-401c-8f33-36c21c0fa498","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:8f0156665aceb19eac1127c2cfbf202ed5c41436733396f5081406b615770863","observation_id":"e8fecd30-9f69-4150-9725-fcd524fd9603","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Yes\", otherwise output","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:029477ff844d91f21a362b56b6e21130919b8e0210e6f0514beef3c34a5f7cec","observation_id":"71784dfd-f297-4844-a6c2-b83b9754e482","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:f7e084573f84ef17d39c2852ea8eb4c493d8d5f7d544e18a410e0e07709ebf92","observation_id":"87664f36-0060-4f7b-b371-5f53abe0e057","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:f8ef796d5132158f95cef605daed68c48f92b0346436def9f8ac66789364daa7","observation_id":"47c7ebac-94cd-4345-a996-9c63e6c097b3","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"We need to find the values ofa,b, andcthat maximize|a|+|b|+|c|while satisfying these constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:4d83653024159a48de433790c62dbd99bb781e7c6274ebd106fa49b9490e20e7","observation_id":"abacaf87-ad57-44f0-afa9-b0b5b76748c9","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Then express a, b, c in terms of these values and use linear programming or symmetry arguments to maximize |a| + |b| + |c|","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:67bb54e7ea0b6caf5fb885e70e4b5580c21261a88a0ff17ef99c87e379726afe","observation_id":"ca748070-bae6-45d3-89bc-0026455624cc","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Apply the method of Lagrange multipliers to maximize the linear functional |a| + |b| + |c| subject to the quadratic constraint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:b8b55dc2ddbc1905f380e40659924c9f6b135246d96ef461d9f17fad1f6f40c8","observation_id":"7c50f582-1be0-47d3-8b2c-b8affaacb8a1","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"However, this may miss the global maximum if the optimal polynomial is not symmetric or has non-zero a and b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:f34a6f95ce6f0a4c7652fde37131b23e03299689fd66d36df2eb19623ed4429c","observation_id":"64a72dcb-d871-4c8d-942c-993140c365fe","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Scale and shift the Chebyshev polynomial to satisfy the bound|P(x)| ≤1and compute the coefficients to find the maximum of |a| + |b| + |c|","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:791bd4074f2bdb47663743487220b2607e2e457f00fbc4a2e852f87f67f0fe66","observation_id":"2bd6b323-e61e-4f1b-aad7-04ed6e6a14da","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"propose-select-think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:b4a717099169455ea6e48ceb06eb7cc1f4546247815e5f60af75189c23793cbd","observation_id":"06aea44a-95a3-4876-8b8e-324c355a9784","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"- PointPis 4 units away from the circle, so the distance fromPto the centerOis6 + 4 = 10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:29a0d0f4b3c07b5d4dc2bc9f6ec2e81b3799b72623cb1ea674ee4567e5f37ab4","observation_id":"db848297-b0a0-4389-a502-48367449eb9e","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"But sincePis 4 units away from the circle and AB is parallel to ← →OP, the perpendicular distance fromOto ABmust be 4 (as 8 would place AB outside the circle)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:ce7d620e776f3b7f7751f8c1021063ee3290c985ae98f560980923e56d3f159c","observation_id":"ea92010a-ee05-4c91-b1eb-61b6c1741a0d","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"- The chord ABis parallel to the x-axis and 2 units below the x-axis (since the distance from Oto ABis 4)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:8fcb1c0c06b5164cd3311a34fe537ab2536b5565ec14200ef548d3f41971a61b","observation_id":"a49c998f-77bf-426b-8104-e315f03ea951","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:f970f3a1fe5db1a7b03573b0aae1f7837e6881d2bd7230cadcae6247792b31a1","observation_id":"12e5b615-a66f-47a8-95a3-63c9337fd251","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"19 Case 2 (Generation Model: Qwen2.5-Math-7B-HDPO) Question: CircleOhas radius 6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:cc6bf175325b620af203bc25d4484915ad19b2f51fc8693543fb05e32ac34b88","observation_id":"fb498f7e-d7a3-41f3-bc09-7119a2cc1a85","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"SinceABis parallel toOP and the distance between them is 2, the perpendicular distance fromOtoABis either4 + 2 = 6 or4−2 = 2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:a121840272148424f73bc3b8efb43943c6b6ed995dcbab078854ff0f660147c0","observation_id":"5a4b1468-b2e5-428d-add9-19958630381e","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:489805c3fee322c82ac2ff7edece3b42becc4830c0a902ff07ee09567380f13c","observation_id":"a1a27ee0-65a8-486e-8b41-3e48c3cc7f62","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Since chordABis parallel to ← →OP, it is horizontal, and the distance betweenAB and ← →OPis 2, soABis either aty= 2ory=−2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:5bdcf379544cc53e00d1b505f502ee6c30024be35df5732062b7f55ac1375901","observation_id":"7e1bcde0-f444-4255-906d-6ae29d70119e","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"propose-select-think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:c1b8fd4deb5f37c9ae5665f12d848882a24a22e68d33cb62243a8a5fa269793b","observation_id":"d04f6e3f-c5f9-456a-b7c2-60bc57b60bfa","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"Then apply the sum of cosine series formula for angles in arithmetic sequence, simplifying the resulting expression using symmetry and periodicity of the cosine function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:6b9a0edcb2d6729f84d55bc61c9e5a6758944e5b65624f085fc50e9c529a6d1b","observation_id":"252f6b2d-5468-478d-8941-fa2f24bf7eb3","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"However, this approach lacks precision and relies on approximation, making it unsuitable for exact computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:a1f73d3c042a94799e873e1afea6083aa0c7689c55b222145d5f8a6694751a8f","observation_id":"c4f4b924-04b7-4722-aad8-9cd5106fbf03","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:e113adf131b248aae6606927893d26d61fa69c0031cda69ace7b392b996555dc","observation_id":"aa14e551-b1c2-478d-8bb3-6488dd20bb50","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:55:33.276019Z","title":"</Candidate Solutions> <selected>[1]</selected> <thinking> We are given the sum: sin2 4◦ + sin2 8◦ + sin2 12◦ +· · ·+ sin 2 176◦ This is a sum ofsin 2 θforθ= 4k ◦ wherek= 1,2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T10:55:33.276019Z"},"links":{"citing_paper":"/paper/2606.03021"},"observation_digest":"sha256:010ed5a9cbaf9dab45484a94145f21060b6aaab297bd3fee537a9b81f954292c","observation_id":"55e0e174-2b13-4aaa-a159-b94a4b861385","resolution":{"observed_at":"2026-06-28T10:55:33.276019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03021","last_updated":"2026-06-02T01:55:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T01:55:54Z","title":"Hint-Guided Diversified Policy Optimization for LLM Reasoning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":28,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2606.03021."}