{"as_of":"2026-08-22T03:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71d6fdb9ce4d185fb98135246cf65ccb33830212e8ef0794f38bbacada27818e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:16:16.243967Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:12:55.560232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01091","snapshot_observed_at":"2026-08-04T15:12:55.560232Z","title":"2026 , archivePrefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-15T22:59:26.336051Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.560232Z"},"links":{"cited_paper":"/paper/2606.01091","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:2b84987e94817f8a9db55f1b8505cf6678a34082b5b3f05d9aef17538b109de6","observation_id":"52111dd3-7d53-42c2-8a8e-8c4deb7fa28d","resolution":{"observed_at":"2026-08-04T15:12:55.560232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01091/citation-record","integrity":"/paper/2606.01091/integrity","json":"/paper/2606.01091/citation-record.json","paper":"/paper/2606.01091"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:b39d340502347acf0cbfd9b5f6b8a8556059cc9c180c161fb49d84922f4cc209","observation_id":"b27f6f4b-0a86-4554-8f44-e5054f702b34","resolution":{"observed_at":"2026-06-28T17:22:25.266810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.641795Z","title":"Does this image satisfy this rule?","venue":null,"work_id":"29a787cd-2797-4d47-96a6-fdcc322ee8b5","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:3fae3033e1ae9677fb6f94a4bc3874445cc19955f01ea511b6c1afb91eddf0c8","observation_id":"2b1eccd0-265f-4be2-9dc1-07a55dba0580","resolution":{"observed_at":"2026-06-28T17:22:25.272102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-16T10:46:56.568912Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-04T02:23:17.018487Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:03c04630457102aaa1fc54e5373a7396d206e85a081eb12b21613e775c8f4c6d","observation_id":"b05954bf-1324-41ad-89f0-0fc2b5e37e35","resolution":{"observed_at":"2026-08-04T02:23:17.018487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:49c2a304c9b6ae2978da986d231cf3d4cc4d3734e122b1a7ef89ea96acd20453","observation_id":"746a89f2-8575-410a-b460-9f61e95aca4d","resolution":{"observed_at":"2026-06-28T17:22:25.230850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07743","doi":"10.48550/arxiv.2510.07743","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":"ArXiv.org","work_id":"b59a07ee-6a84-42cb-8d41-9b665841aa2b","year":2019},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:c2fc293e0f8e695b4803d4cc63ecda42a67745884728c6ce471132f529c44fb4","observation_id":"62da4def-c4b9-4d5f-b6eb-a2f5511e4da1","resolution":{"observed_at":"2026-06-28T17:22:25.249178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17314","doi":"10.48550/arxiv.2510.17314","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-rubric: Learning from implicit weights to explicit rubrics for reward modeling","venue":"arXiv (Cornell University)","work_id":"66c4c984-2f9f-4553-9acc-b1b1d4431cfd","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:582e1feedbff1f6247d3bea284dd4d50c1d56b27efc2ab83803d52930d9d21a4","observation_id":"5907b663-2a4f-4d98-acb8-805fa0ad37cc","resolution":{"observed_at":"2026-06-28T17:22:25.253380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:4cf84752b5e85b38fe8016592d1d079acf3d83dff5286d0c7ae1ce96de94bc1f","observation_id":"3941bab8-d0b9-40f1-bfed-1402aadd0e4f","resolution":{"observed_at":"2026-06-28T17:22:25.224950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.04903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:22:25.225994Z","title":"Ace-rl: Adaptive constraint-enhanced reward for long-form gen- eration reinforcement learning.arXiv:2509.04903","venue":null,"work_id":"1af4f893-44b3-4ce0-a489-0b325ed1902a","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:cb3b96e4484ba46c3385b5e7c7465d0c9b6b9c1bd684dce2d825f16898d69f52","observation_id":"bc13d997-a825-491b-865f-883841171186","resolution":{"observed_at":"2026-06-28T17:22:25.228460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-08-14T13:19:21.831179Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:a70c13fe646bfb9900b9b470cf18f2414d347ffd32f847843d47dee47f6ccd4a","observation_id":"64f4f153-758b-4776-99f7-0dcf40ba721e","resolution":{"observed_at":"2026-06-28T17:22:25.222137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.762854Z","title":"Online rubrics elicitation from pairwise comparisons","venue":null,"work_id":"997bca21-08ad-4445-841f-1609abeb4657","year":2019},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:133f39e5319b54c52ecfb7518a797c9b153568ecd3f4b54f2ee4bddda6ee23f1","observation_id":"232c5f56-bb53-4007-83d2-b362eaf15298","resolution":{"observed_at":"2026-06-28T17:22:25.196101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:bc02db402501d1ab93c7409a5d36290031c5e8b011fdb444ef746f4309671ac6","observation_id":"4117f923-51b9-4dc9-bbe8-0eb643545e28","resolution":{"observed_at":"2026-06-28T17:22:25.205772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-19T08:48:56.371619Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:7761dd1b8094b8b4354d95ecb8561aeed25d046bf99a531f7d2d6f1bbdc94d33","observation_id":"6e8cb5c8-7a52-4cff-aab2-e8887021991f","resolution":{"observed_at":"2026-06-28T17:22:25.217916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:80faa95c0d655edda95c2e9b00abd25cf90951177da2534dabe8ec9868562aac","observation_id":"3f85ff3b-6de0-4164-9839-a75efce56570","resolution":{"observed_at":"2026-06-28T17:22:25.254132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.00496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:07:56.265515Z","title":"Yifei, Allen Chang, Chaitanya Malaviya, and Mark Yatskar","venue":null,"work_id":"012b34c2-72cd-4df5-9ac6-6f954320da1f","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:2e46e45042cbe2a8de6ffe0198abdc3324a6d084b70ba0e39919c80abcec021b","observation_id":"cbb69757-6b27-44c5-853a-7470c156e2be","resolution":{"observed_at":"2026-06-28T17:22:25.229793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-18T17:58:16.707563Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":"2506.11763","doi":"10.48550/arxiv.2506.11763","metadata_source":"pith","pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","venue":"cs.CL","work_id":"449edaa7-8f9d-4170-952d-4ab0d740572c","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:157f0342a7e73a539b0f6afe3c5ba392831bf53f8c3aaca166a6b629782e2c3c","observation_id":"5155c358-dafc-4720-a626-f8af2e1cefc5","resolution":{"observed_at":"2026-06-28T17:22:25.262928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.66339+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07436","last_updated":"2026-05-31T11:02:36Z","snapshot_observed_at":"2026-08-07T09:13:55.130091Z","submitted_at":"2025-12-08T11:12:39Z","title":"LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services","version":3},"cited_work":{"arxiv_id":"2512.07436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07436","snapshot_observed_at":"2026-07-03T20:08:56.737986Z","title":"LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services","venue":"cs.AI","work_id":"d20673c2-1f0c-4b12-8c36-aa9357c57b7b","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2512.07436","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:208ff2dce34f693ffad6930f5225d727a92ef3b67906719a2223fe4576d33cd6","observation_id":"848a95d9-be29-41db-bd86-63b17b26cdf8","resolution":{"observed_at":"2026-06-28T17:22:25.240787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:e062a9550a303c64c7e82d1bdcd43c4acb1f06bc2f19044980cb7ff74bb2f884","observation_id":"d87bd96b-f254-4167-ab32-88a1a02e5d6f","resolution":{"observed_at":"2026-06-28T17:22:25.260671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:a53dc1bc873472da66b9cec87ba83694601b09c39206be5f3ce17fb4c26a0b35","observation_id":"3cc9edea-ea60-4c30-9f8a-3b0291df48e2","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:ef509857270833ad6838d249dc264789dcf77c113b5902cef4aabb9965a2bb09","observation_id":"23dc7db0-17e9-4eb9-bf0a-36c7003507ba","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:f98ba5b98cf4ae1fc16855fe4b17362d29a6a92489acc34d98a53b4e289f76dd","observation_id":"bba97290-5146-478a-90af-d15bfaaab146","resolution":{"observed_at":"2026-06-28T17:22:25.220503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:14721a241d79d7be2f6493b82bacc77d609e6a21049f8cc9075d345c9d717cba","observation_id":"6687768f-6bdd-4fdf-8518-d9f7a85e1949","resolution":{"observed_at":"2026-06-28T17:22:25.245545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-18T10:06:51.290180Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:df2cfd793779287a9c05bb331098146f6bca6a01f7e934b9509de71d277e3985","observation_id":"9821d9a6-fad3-4048-a98a-743e8d7f257d","resolution":{"observed_at":"2026-06-28T17:22:25.262998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:8c103b70a53ceebd91c90c4037a8f4d6cd32dc415cd03d1a401bea1c865cf411","observation_id":"88a9dbb6-e9b6-4cbe-a35a-8e1aaa2ab213","resolution":{"observed_at":"2026-06-28T17:22:25.256554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:4906eeb162449cfa790b09c79714314adba1ec4a4571d3427c6c7bf99e45ccd5","observation_id":"6c6e216f-1c95-453f-aa55-18750f45483a","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:dd2112901b566f51abe285a04c652a12a7f291fbc40d427908c4d30eb8e55300","observation_id":"54014562-b249-4d55-8e3b-2a83a15dda66","resolution":{"observed_at":"2026-06-28T17:22:25.269360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":"2504.21776","doi":"10.48550/arxiv.2504.21776","metadata_source":"pith","pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","venue":"cs.CL","work_id":"7e319d34-eb88-4ea9-8c0d-b66320599f98","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:71126069009f819096560ce4b16efccacbabeed42f9a498c979453f5f3b09b5a","observation_id":"8cec7187-514e-4c1f-bddf-fea4ebe3799e","resolution":{"observed_at":"2026-06-28T17:22:25.255714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":"2510.24701","doi":"10.48550/arxiv.2510.24701","metadata_source":"pith","pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tongyi DeepResearch Technical Report","venue":"cs.CL","work_id":"1c8db01b-b50f-4711-b181-a04bcc3e9aa8","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:4486d0451b33bbe8edccb4ce46925f88ce13dad48967ce53b4da865f59dcf873","observation_id":"44e285c9-dbe7-449c-b9e3-40da58f07dd3","resolution":{"observed_at":"2026-06-28T17:22:25.234975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"DeerFlow: Deep exploration and efficient research flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:df9ac37941ca663bb2153e6537f2095d5159b7837774e32251b43e9b289417e0","observation_id":"7dbca3a0-339b-4850-b327-830d3a2e4d52","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:1f46352058d0f62e6c4fd5160082bfd9ab9ffc6e89d4c02ad83f08a3693c876e","observation_id":"738da4a9-0a84-4420-b07f-6d75c523112d","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:9c425184d3434e0e76e167387a49f227fd27a564f093f1b66e370971549307d9","observation_id":"8012d27c-7e90-4291-b2d3-ccf9558b6322","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":"2601.08584","doi":"10.48550/arxiv.2601.08584","metadata_source":"pith","pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ministral 3","venue":"cs.CL","work_id":"6f314463-0f42-4eea-a5c3-607e733d6afe","year":2026},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:2dfc0d776a6b240ce9500e8e48636ccebcbcb5f519c85b4867c875c8e3e08035","observation_id":"c9517785-0bf6-48e1-9394-07be6455558d","resolution":{"observed_at":"2026-06-28T17:22:25.232087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:27:56.457631Z","title":"Mirothinker-1.7 & h1: Towards heavy-duty research agents via verification","venue":null,"work_id":"fb535f2a-eeb1-4b72-9ed3-24c9a3141f44","year":2026},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:9b07f9985e32eb1b78bf331713b5a219e112354215f6b7acb1ac00b6e57c7151","observation_id":"06387279-218c-4fce-9484-efc3897278f5","resolution":{"observed_at":"2026-06-28T17:22:25.237850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"15 System Prompt: Stage II (Rubric Synthesis) # Role Definition You are an expert in evaluation framework design for academic research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:e2f6c6dd92e70f27bd31502eee8bdfec7913a57e523b34f98c70697d8fef502d","observation_id":"39935e55-a2a6-41ca-831f-6b4beb816b50","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"This report contains the necessary factual information (algorithms, parameters, benchmarks, etc.) that a high-quality responseshouldcontain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:2cb9172e947000fa5cc08ebe4b7961aec8cc1f999daaa5a14558ac43e90fd099","observation_id":"c357a92e-209b-4ac7-b756-d09db642d14e","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Prohibited Content:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:b6a11bb7dc0fd264b25ed8621114d0b972f8dbd120414d2cbea564f5b23ed276","observation_id":"9eb1a042-58c3-480d-852c-c5df007ad39a","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:37a82e1d5361f50e689b59c38b775af16ff31141ca3a63af7d7693053e7eb823","observation_id":"c1d1d5c3-33f1-46d8-9339-2d75ec8ad8c3","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:73792cc92d6041a8eb659ffee89671727399af9508688262aec7d66cfa36fe1c","observation_id":"faeef9c8-f511-4659-940b-59175fcded02","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":">=[X] specific algorithms included","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:01b5bacd36fd57a2e940af1ca7516093ec33f82cddb32dbe92cbcccf01f1d690","observation_id":"3cdd257f-5e00-4301-a97e-7a0fa58140f3","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"#### Core Dimension:","venue":null,"work_id":null,"year":2057},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:b8b24e2a885ad263c84e0f10d6d1ed708aa5b2a212bba26e726077be907b5e1a","observation_id":"530da140-3af1-47d5-9af4-bcbe9578a6d2","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Stop ifP n >max(0.15,2×P n−1)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:59b23db6e727dbd52196a34548dc70cffa09d283c5d994747da1622521f7e9f4","observation_id":"7642a616-1f32-43a3-b269-9e3947dd9f70","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:4df518b63d9d994234f969166342c20292a9c24d0d2fa1dd66e65fd475017c8b","observation_id":"4d4faf62-6194-4773-ad17-b23b647fac37","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:16:16.243967Z","title":"Retrospective validation on both scales: this rule correctly selects BS-2 and terminates at BS-3, avoiding BS-4/BS-5 and saving 40–60% of total bootstrap compute","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:8b124803a8b6d424b01a6b9975e2fb85d7cd0cf149fce5dddd0906dcac45b4c7","observation_id":"5a4d200d-0955-4ddd-94f3-dcd863013a83","resolution":{"observed_at":"2026-06-28T17:16:16.243967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":14,"verified_exact":23,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2606.01091."}