{"as_of":"2026-08-12T04:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a417b391a8b1865fdf16108762a8b94cc843e509fb7a1c574d0d83ead81a2f8d","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:05:25.567581Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:10:34.539760Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:10:35.007568Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"cited_work":{"arxiv_id":"2605.08703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08703","snapshot_observed_at":"2026-08-11T13:10:35.007568Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","venue":"cs.AI","work_id":"e0fb01d5-9aa2-421a-935c-25684854c9dc","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-12T04:19:20.755896Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.539760Z"},"links":{"cited_paper":"/paper/2605.08703","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:7c60c20e14ab6403ec9dc182a388b6b27f3e084e092a2626c0b166bdb4b12370","observation_id":"2765068d-88ee-48b8-9d9d-6331df4fb633","resolution":{"observed_at":"2026-08-11T13:10:35.013589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08703/citation-record","integrity":"/paper/2605.08703/integrity","json":"/paper/2605.08703/citation-record.json","paper":"/paper/2605.08703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T16:51:14.299739Z","title":"Blip3o-next: Next frontier of native image generation","venue":null,"work_id":"b51bf787-a19b-47bb-9114-1a1a29263297","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:a8acf3390aca9b895b06e1b80991e2fdafd877f1ac62f1c1f58b5928de4a0d10","observation_id":"fdc92b74-d49e-46b7-92c1-4a8580a600a9","resolution":{"observed_at":"2026-05-12T08:31:24.128142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:803cf7411589afd49a4026f565660491a428e35ae099976171854eeffa53981c","observation_id":"efad21b1-b6e2-485e-93fd-5e4f8421cbb1","resolution":{"observed_at":"2026-05-14T23:00:22.024625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":"2504.11536","doi":"10.48550/arxiv.2504.11536","metadata_source":"pith","pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","venue":"cs.CL","work_id":"6da510e4-e55c-4412-b7c8-839984508e99","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:805bf8080c60a9b0251957a86e3af6e53f8796f7d9e6785a1b9afea6ed9e4fb6","observation_id":"9eb5df50-3df0-4f3c-adac-ad2123dcd94b","resolution":{"observed_at":"2026-05-13T18:42:39.160125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21066","last_updated":"2025-08-28T17:59:46Z","snapshot_observed_at":"2026-08-10T04:28:29.855763Z","submitted_at":"2025-08-28T17:59:46Z","title":"OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning","version":1},"cited_work":{"arxiv_id":"2508.21066","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21066","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Onereward: Unified mask-guided image generation via multi-task human preference learning","venue":null,"work_id":"ae97244c-ffbd-4c00-82ee-89f3fdece7f4","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2508.21066","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:d1aa09eb633a0882d8366ac7e25e07e8866611ffccd2253d2c84efa8f61f48c6","observation_id":"46d4b809-2fb4-49b2-b61e-0b093d3aa756","resolution":{"observed_at":"2026-05-12T08:31:24.121541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolkengpt: Augmenting frozen language models with massive tools via tool embeddings.Advances in neural information processing systems, 36:45870–45894","venue":null,"work_id":"e73b4c27-25ef-4d12-9f1b-acb3c8c0c176","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:5200f17a50cbd9af9b39c9ead5897d5e61edd1df3dbec16144081a3ae4d7eb24","observation_id":"375a63eb-7ebc-4918-b512-785e9187dd42","resolution":{"observed_at":"2026-05-14T08:46:37.166374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rise: reasoning enhancement via iterative self-exploration in multi-hop question answering","venue":null,"work_id":"a6104d8d-0867-4bad-a286-7fb6f750666b","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:8fde546e64573e4c1d98613d00cf93a6a82916dad867e94f251e7d11f11ad044","observation_id":"c64d9751-e8f7-4ef4-bf28-cc6469e781aa","resolution":{"observed_at":"2026-05-14T08:46:37.171525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.825321Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":"a95a4387-dcbf-44b4-b3ed-2111b55ee80f","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:0069a61a8b579432ecd275c6e5addcdf03656eea14242237c4ee859dd8f9c123","observation_id":"d5e6ca73-60a9-421a-bcec-c4a18cabf745","resolution":{"observed_at":"2026-05-14T08:46:37.168933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:27:56.742672Z","title":"Huynh-Thu, Q","venue":null,"work_id":"8b5960e1-cfbc-46a2-b0ae-e98f990faa4c","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:31557ee09bd22e501b3ee5a8125f765cc9696176544a39cd9b50891a37e8a87b","observation_id":"efea3658-4c47-4a44-b1d9-9e0b3c00777b","resolution":{"observed_at":"2026-05-12T08:31:24.100619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04485","last_updated":"2024-11-11T06:32:24Z","snapshot_observed_at":"2026-08-10T15:18:27.026026Z","submitted_at":"2024-06-06T20:15:42Z","title":"GenAI Arena: An Open Evaluation Platform for Generative Models","version":4},"cited_work":{"arxiv_id":"2406.04485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04485","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genai arena: An open evaluation platform for generative models","venue":null,"work_id":"d496e8d3-6b70-4e41-b719-8a659dd9049c","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2406.04485","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:296c020e9781e9c6aec18fcf559ba682478a3cbe0d7adfe09b206cfb47a0c9c5","observation_id":"85d1ef97-27f3-468f-a439-dd6efda9b83b","resolution":{"observed_at":"2026-05-12T08:31:23.989227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.476341Z","title":"Verltool: Towards holistic agentic reinforcement learning with tool use","venue":null,"work_id":"b23dbbef-f1e5-4b1a-8ae5-6dcca5e78dc8","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:f7f3d9dd5386144ae51cbf8b6a5e0b9f62bfd1f228a8db7a739cdc3b85ac9116","observation_id":"469c712e-747a-4417-b62b-71ad55dc4cb1","resolution":{"observed_at":"2026-05-12T08:31:24.089429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36: 36652–36663","venue":null,"work_id":"f5017936-3f5e-42c8-bcc4-a258303c010a","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:d01ef5c1ca4304ff17a1153fc2d02e61a730c8e788011e62446606492afbbfa5","observation_id":"0b3117d9-a646-4e91-801d-fb2c7b88082f","resolution":{"observed_at":"2026-05-14T08:46:37.892144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"cited_work":{"arxiv_id":"2510.16888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16888","snapshot_observed_at":"2026-07-05T16:51:14.250864Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","venue":"cs.CV","work_id":"9687bd6c-c4f6-4f49-ba59-ca7e825f0710","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2510.16888","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:45977ec3be7c38ba24369a841288608747da4f4d19fdd084a72261f8e5361767","observation_id":"82ccfb0d-475a-4125-b6d3-f7b9b40bdd5a","resolution":{"observed_at":"2026-05-21T18:01:19.940440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":"2084f9b6-aafd-4c58-938e-785094cc2ddd","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:56991fcea1cd564ad61c49bd2465663984a03d2076ef21c027c016ebff4537d2","observation_id":"5a2fce87-eebd-4fae-b304-d56f27dcfb1e","resolution":{"observed_at":"2026-05-14T08:46:37.900906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19900","doi":"10.48550/arxiv.2511.19900","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent0 -vl: Exploring self -evolving agent for tool -integrated vision -language reasoning","venue":"ArXiv.org","work_id":"a0b54170-89b2-4a4b-b390-b92a36cb244b","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:74f98141ddcb0c1ffee186d37cc14433a826ac1fab071a6c889aa0eb4fb7846a","observation_id":"3c323698-ace6-4928-a4cc-4d5ca961af12","resolution":{"observed_at":"2026-05-12T08:31:24.071180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-30T14:25:28.966971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T14:25:28.966971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02553","last_updated":"2026-01-29T15:45:24Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-05T21:02:49Z","title":"SimpleMem: Efficient Lifelong Memory for LLM Agents","version":3},"cited_work":{"arxiv_id":"2601.02553","doi":"10.48550/arxiv.2601.02553","metadata_source":"pith","pith_arxiv_id":"2601.02553","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleMem: Efficient Lifelong Memory for LLM Agents","venue":"cs.AI","work_id":"9b5b2649-8727-425e-a2c5-60f49518a5c4","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2601.02553","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:6bfc0252e3b2b723a439f23384cda01d6a781011eb74e1e602e0f868978e8275","observation_id":"d5247429-535d-4695-b079-fd10bf6fc08b","resolution":{"observed_at":"2026-05-22T08:10:45.412758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:f24c2c86779bfe6a7e2007638d30b194b43c1c05fbf5ad038522e6b9b68d500e","observation_id":"2f983c53-06db-4c18-9dee-c08c069ada61","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23909","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:59:52.733583Z","title":"Editscore: Unlocking online rl for image editing via high-fidelity reward modeling","venue":null,"work_id":"478d04d3-d99b-4a09-b3b5-cc62c6528bf7","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:bfb6a05ea734e501f424face5ceeef9a05887071ebfa4b0ae98081f892df9b82","observation_id":"e176e5dd-0549-4167-b6cb-6f8c9e8c2af2","resolution":{"observed_at":"2026-05-12T08:31:24.026974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":"2305.15334","doi":"10.48550/arxiv.2305.15334","metadata_source":"pith","pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gorilla: Large Language Model Connected with Massive APIs","venue":"cs.CL","work_id":"126a464a-4a73-495f-b669-de1e44aa8f09","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:94fb1802ee53584466449be9365abb2ac07784b8df4493a8b77f1dd582704015","observation_id":"9671900a-b8a7-4e38-8724-c982f3b473a4","resolution":{"observed_at":"2026-05-12T08:31:24.048941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15374","last_updated":"2026-05-28T03:31:48Z","snapshot_observed_at":"2026-08-03T15:56:26.928934Z","submitted_at":"2025-12-17T12:25:05Z","title":"SCOPE: Prompt Evolution for Enhancing Agent Effectiveness","version":2},"cited_work":{"arxiv_id":"2512.15374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15374","snapshot_observed_at":"2026-07-10T16:07:20.364083Z","title":"Scope: Prompt evolution for enhancing agent effectiveness","venue":"cs.AI","work_id":"7cd17168-8fda-44b6-b747-1856b6f5c987","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2512.15374","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:5cc9f1dc1fbc2f1f3d42e4b025f55b731d60747acf04f8353eb79f47ca6385ce","observation_id":"9eaf8da1-b333-4104-ab6a-1ee984bd3a60","resolution":{"observed_at":"2026-05-29T02:04:59.937936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":"2307.16789","doi":"10.48550/arxiv.2307.16789","metadata_source":"pith","pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","venue":"cs.AI","work_id":"3c555b48-a4d9-42dd-9fdd-0f6018fbe9cb","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:24a850931cb355976e35cd8af109b50b59319e64061889a0d00872e10bc82d2b","observation_id":"7bd8e4fd-ee45-4f0f-bfba-ed497ac78968","resolution":{"observed_at":"2026-05-12T08:31:23.948530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evolvecoder: Evolving test cases via adversarial verification for code reinforcement learning","venue":null,"work_id":"b406e4f3-0144-4905-ac34-b9c49716ec8d","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:5f15fbedc59bc2f73c159c723be3e2421dbb3d53a35c4547fc37968c99c98192","observation_id":"7c779478-0a76-4424-ab4a-d8dcf389bc7e","resolution":{"observed_at":"2026-05-12T08:31:23.977490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.177910Z","title":"ImagenWorld: Stress-testing image generation models with explainable human evaluation on open-ended real-world tasks","venue":null,"work_id":"751e8749-d9b8-4b7d-af49-1471e050d4aa","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:e04f9beaa15b0f35fa0ef7574fc336e7966940e94140b4314f3421c4677ff780","observation_id":"473738f4-cca5-4cf2-8fc7-43b629d12b27","resolution":{"observed_at":"2026-05-12T08:31:24.014537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.611981Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in neural information processing systems, 36:8634–8652","venue":null,"work_id":"a7867616-b761-49f9-87e2-c36aa3664b6f","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:5acf8e98f29ab68e75a4252e70962a798b1de5c71e39bf7311a8eee3bb76ea34","observation_id":"1607fb23-ac9c-492e-8dec-95ab42a8861b","resolution":{"observed_at":"2026-05-14T08:46:37.903050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:02.082999Z","title":"Cognitive architectures for language agents.Transactions on Machine Learning Research","venue":null,"work_id":"bdce1dd5-afa9-4649-a283-522101c8ad92","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:97ba2d2f418120ade58b94cc7a8584532aae2ade67b35fb749c409b5714243ee","observation_id":"cc7a09bc-5203-48df-9820-0d6ac9963a4c","resolution":{"observed_at":"2026-05-14T08:46:37.913389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-11T04:55:17.296477Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:124eb4839e84a35cb3e8bfc3a67acc7f33f874bee9b0f227352116ea6e92e627","observation_id":"2619ad0c-fc3c-45c9-8374-4ed6ab95b580","resolution":{"observed_at":"2026-05-12T08:31:23.995255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-11T16:01:36.938012Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.16291","doi":"10.18653/v1/2023.emnlp-main.118","metadata_source":"pith","pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","venue":"cs.AI","work_id":"ffe0d207-86cf-4742-a100-e988ac8b9676","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:fe2ca88e5d2d6f09884f4bbf98d0e4f6c9b73e29ebc9538b20e58f9e48232d38","observation_id":"e164b9ab-aaae-4b90-89bf-0807cbf678fa","resolution":{"observed_at":"2026-05-12T08:31:24.043729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2503.05236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-07-04T16:59:58.010213Z","title":"Unified Reward Model for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"bf9fcf9a-1781-4008-960e-2bec1a717e4e","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:528215bc70030cd1e934bdf29a39095bfdb82b91ff77ee5699c2f481e4f16ca9","observation_id":"78ba788e-e526-4e7f-9f72-7dd17105962f","resolution":{"observed_at":"2026-05-14T00:44:31.060111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":"2502.18449","doi":"10.48550/arxiv.2502.18449","metadata_source":"pith","pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","venue":"cs.SE","work_id":"4b93fb93-87c9-40fe-84d0-d7ecb4e11bed","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:270751094209d6b6cd213ecd8027b9df7dcca45cedece656b2e062f01782764e","observation_id":"733391c0-38ea-4275-bf5a-a43a158a1a9f","resolution":{"observed_at":"2026-05-15T10:27:56.991478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:59:52.698229Z","title":"Editreward: A human- aligned reward model for instruction-guided image editing","venue":null,"work_id":"44f2e6b9-ba11-41a2-9c4f-aee7a3bc1178","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:d9d2d573936268a4dd1d0bbb31172b148600528dfa5f0e2c79f6fdd816e62775","observation_id":"651fe9d3-dd24-4206-9a4d-d1a24773df22","resolution":{"observed_at":"2026-05-12T08:31:24.054975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16079","last_updated":"2026-05-16T02:57:47Z","snapshot_observed_at":"2026-08-05T00:54:36.690304Z","submitted_at":"2025-10-17T12:03:16Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","version":3},"cited_work":{"arxiv_id":"2510.16079","doi":"10.48550/arxiv.2510.16079","metadata_source":"pith","pith_arxiv_id":"2510.16079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","venue":"cs.CL","work_id":"350af93c-7749-4477-8163-e35d2cac8d96","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2510.16079","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:d540a378c0c0a9126a560c5b9b975dc441a61e77c3be632fab8bde16969122df","observation_id":"8c8a0a68-b4a7-4909-8c5f-4c13558d6a15","resolution":{"observed_at":"2026-05-12T08:31:23.961457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16043","doi":"10.48550/arxiv.2511.16043","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent0: Unleashing self-evolving agents from zero data via tool-integrated reasoning","venue":"ArXiv.org","work_id":"d7e7b19a-a84a-42be-ad4a-550238c4747c","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:98185104a8a2a781af7cf5af9cb8e93086209a47abbd0838532f0c5a4b5b7fb8","observation_id":"64120d82-032c-4be4-a6fd-92d4c2d5ef61","resolution":{"observed_at":"2026-05-12T08:31:23.955791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-07-06T22:45:05.823859Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2602.08234","doi":"10.48550/arxiv.2602.08234","metadata_source":"pith","pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","venue":"cs.LG","work_id":"536a9d0a-baed-4eb9-9a51-f2b585c3388b","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:c0bd7195dd76d9f578d5913fdfcb38c1c3a00eb414fdcfa991b74758c837c303","observation_id":"826638e1-4f91-4922-9305-2621d8e0bdfc","resolution":{"observed_at":"2026-05-12T11:39:12.115659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.861937Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935","venue":null,"work_id":"e1b4fb5e-923d-4861-9e59-7792782f1cb4","year":2023},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:22edc306f88ba1e79f5aacf941d3f190d29082e280e721a086f6d4aa49d614d1","observation_id":"39106a55-240e-44d6-bf21-91eef73abc8a","resolution":{"observed_at":"2026-05-14T08:46:37.881097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-11T09:26:15.802106Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":"2412.21059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-07-03T00:07:27.977777Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","venue":"cs.CV","work_id":"63f252a7-e52d-4e87-b849-d1375bee5b37","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:b53e4ebb829d1aa7b5c7b894377e256d52582af085cb34fd069bc962e43bc9c8","observation_id":"ecea3a61-c1a1-4ca3-9da6-94af92d5a38f","resolution":{"observed_at":"2026-05-16T11:49:14.981353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-10T06:20:33.458844Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":"2505.07818","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-09T03:05:55.316091Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","venue":"cs.CV","work_id":"7404dd36-8f9c-478f-b089-ef9f8189c711","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:714470ef548bc42ad257c1b5d4bec79a129c064d08bb4bbc679ec3a35dce9992","observation_id":"0e147f5c-8042-4785-9923-2dee8dcbfac1","resolution":{"observed_at":"2026-05-12T08:31:24.020704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:37:32.087006Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"404308e4-3b7a-4845-8899-d58a0072d6ed","year":2022},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:c004c36241871d0827bf87d1e8b83d5759e2f218842d02e8ae6a04ff6c5562ee","observation_id":"6e4b89f5-f1c8-4211-859d-8a1cb9134090","resolution":{"observed_at":"2026-05-14T08:46:37.908688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:b57e0669ed8d52ec9d1ad3df198db304b639bea0cf4eed6b17e49df6c29d01aa","observation_id":"c361ef97-08c0-4627-ad28-a3a3e2580100","resolution":{"observed_at":"2026-05-12T18:17:45.693018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-rewarding language models","venue":null,"work_id":"7a361202-e978-463c-a211-05dbfeeae1a8","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:7c72cbd3ccee0e148ab720fd7b43c06965fe4f8a22dd3485ee44a2d566e12146","observation_id":"950bd797-e66c-4a5c-8c42-27d009a53289","resolution":{"observed_at":"2026-05-14T08:46:37.874306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:37:31.974827Z","title":"Star: Bootstrapping reasoning with reasoning.Advances in Neural Information Processing Systems, 35:15476–15488","venue":null,"work_id":"881016d6-8d7b-4c2d-bbe1-05339013b83f","year":2022},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:38d0d364162356b23e7c08c4c6a22cdc7a92d87c69d56a44f56a7aa4402ab748","observation_id":"97123500-3014-4aa4-9b44-8674963a7ef9","resolution":{"observed_at":"2026-05-14T08:46:37.860394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":"2510.04618","doi":"10.48550/arxiv.2510.04618","metadata_source":"pith","pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","venue":"cs.LG","work_id":"c1d09cf9-9176-403d-8028-630bbc0cbc5d","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:916abd3f05510672ac8144a8fbd4a6256a25438926df1925f78fa56ff4e9409d","observation_id":"18bb8e0e-d8ee-46d4-917c-c6b9f9807694","resolution":{"observed_at":"2026-05-12T16:44:08.223014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-10T20:58:01.238928Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"cited_work":{"arxiv_id":"2604.05117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05117","snapshot_observed_at":"2026-06-30T06:14:18.593976Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","venue":"cs.CV","work_id":"2ad83861-2cbb-4467-b789-b17540578574","year":2026},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2604.05117","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:97f1f1d05c209fd4cad1edc52811a997e6e020e11ba6f85b0db084cf16e06402","observation_id":"9e05f455-34e0-4611-8690-d7e79faaf16c","resolution":{"observed_at":"2026-05-12T08:31:24.008246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.677823Z","title":"Expel: Llm agents are experiential learners","venue":null,"work_id":"55f72706-b61e-4ecd-aed4-86d9d2d2e906","year":2024},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:8aa915ec57ad419e6a023051d346e870bf4ab4fab10ca3ab12fbce076ee5913e","observation_id":"c653dce5-864f-4656-a50c-2729c3645630","resolution":{"observed_at":"2026-05-14T08:46:37.176254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":"2509.16117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-07-04T19:50:11.382174Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","venue":"cs.LG","work_id":"0ed3cf57-36ba-4962-847e-7a8f5f99901d","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:697a8b39b6865d2d84ff139ccb5e28f2678341d50376c10c99efa70e79c88c48","observation_id":"98001f8c-bc21-4200-bfbb-ef193c9cd20c","resolution":{"observed_at":"2026-05-13T16:54:31.055857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cartoonish or heavily stylized outputs score 1–2","venue":null,"work_id":"57d91efe-2d50-4333-9248-d22b9e4060ff","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:90c0b1d106f79dd8c34d393a40599e5f647c917f2a2de28835083976ba6e5c2a","observation_id":"1697992f-216d-4bb8-a5b2-5e06b100509a","resolution":{"observed_at":"2026-05-14T08:46:37.868013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"884c60a1-bb20-4d40-8abe-452611b70c8d","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:668d046224269c565f06ee4975b78f6092265a50839b48ae41fe0f5ff70ffd54","observation_id":"9e669c7f-324d-43ac-b377-2465f808010d","resolution":{"observed_at":"2026-05-14T08:46:37.884643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skill: realism-and-artifact-penalties (iter 69, reﬁned) description: Guidance on penalizing artifacts while allowing conceptual unrealism if requested by the prompt","venue":null,"work_id":"a9613d35-9499-485b-b09a-1bff9e54efc8","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:2f1e775badd665a94c84b8015c2a39596b497aae35d44e803d3a12a67da89ad7","observation_id":"0f93334e-fdbe-4100-b9e5-b0a21e2527e0","resolution":{"observed_at":"2026-05-14T08:46:37.895968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artifacts: If the prompt requests a surreal/ impossible scenario (e.g., ‘polar bears in a savannah’ ), DO NOT penalize for being unrealistic","venue":null,"work_id":"c883f6ae-a256-475a-8350-0a72784d534e","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:7d3acd506a5641010e0a85bae867db5aba9cd21c965fd30ebc396ae0e060aa8b","observation_id":"2fefec41-e4a3-4227-8725-04105578e2f1","resolution":{"observed_at":"2026-05-14T08:46:37.889360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c734f9e-bdf8-4175-8691-c50a6f04508c","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:39d606c609f1fb7103be46a1770995c508b8cf1cc5a30f83a7044ea42bc39ebd","observation_id":"644e4c52-5f91-4144-85c4-d8742c016656","resolution":{"observed_at":"2026-05-14T08:46:37.840402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"polar bears in a grassy savannah","venue":null,"work_id":"fd6b8e2f-6260-41f9-8702-bfdebd9533f2","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:129c5e446179ba53d47d4f49edbcda44a941e794c92f903049ae1409dc266c28","observation_id":"d3cb5738-efe3-4545-9734-4d80e939a8cb","resolution":{"observed_at":"2026-05-14T08:46:37.905436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"query”: “Is this image completely black or corrupted?","venue":null,"work_id":"1200fffb-4eb8-4f67-916f-1d9ce61fa5e4","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:93b5d00e03ed30931a9986dca3c6ea145c934999dcb3a0331deabaf39aea5ed8","observation_id":"cb33423b-7090-47f2-8bbb-3735a4ab1402","resolution":{"observed_at":"2026-05-14T08:46:37.899067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Use text-and-ocr-analyzer to read the exact spelling before judging","venue":null,"work_id":"8d67d512-794f-4986-988f-70d6661bc1cf","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:424d6a65752ef3b6f88c8ef2be1a9d20d0d6b809119aa9ce7996b6a9487a0486","observation_id":"334a64ac-76f1-4208-b7e5-615823b7818d","resolution":{"observed_at":"2026-05-14T08:46:37.911197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"a clear plastic bottle with a nipple","venue":null,"work_id":"27ac74d5-59a1-45bf-b1bb-2d1bd7eaeaa2","year":null},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:bbdd8e9d6c0a1e6a0af696e36d67e3fd5df3e55938a2e13d143d571dc785ca55","observation_id":"865297ac-d243-4743-9d87-beb7d18fb5d2","resolution":{"observed_at":"2026-05-14T08:46:37.174049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":30,"verified_fuzzy":19},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2605.08703."}