{"as_of":"2026-08-07T19:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34846d23703e5873f14215aa51a5112a827cd2e447abeb2d1a63e78f31611f34","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:33:00.408984Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T22:51:49.158185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T07:24:21.967669Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"cited_work":{"arxiv_id":"2606.02355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.02355","snapshot_observed_at":"2026-06-30T07:24:21.967669Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","venue":"cs.AI","work_id":"ab0d0146-b26a-4ac8-9c6f-65c58f16c8c6","year":2026},"citing_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T07:15:44.387347Z"},"links":{"cited_paper":"/paper/2606.02355","citing_paper":"/paper/2606.29502"},"observation_digest":"sha256:e9857648180f9f052a7e677b8ae121b8778f2ca8015d7d9ab92d7362f5dd948d","observation_id":"cc2f660e-94ac-46f5-9b76-8877455630b6","resolution":{"observed_at":"2026-06-30T07:24:21.969035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02355","snapshot_observed_at":"2026-07-31T22:51:49.158185Z","title":"arXiv preprint arXiv:2606.02355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27937","last_updated":"2026-07-30T09:47:58Z","snapshot_observed_at":"2026-08-06T10:28:04.843430Z","submitted_at":"2026-07-30T09:47:58Z","title":"From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T22:51:49.158185Z"},"links":{"cited_paper":"/paper/2606.02355","citing_paper":"/paper/2607.27937"},"observation_digest":"sha256:a210408d807c8f20599ba61d456648dd6f0b449d9e88d374983c6bb434f02eb0","observation_id":"23a05fea-0bd5-4aee-93f2-bac8687bf5f0","resolution":{"observed_at":"2026-07-31T22:51:49.158185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02355/citation-record","integrity":"/paper/2606.02355/integrity","json":"/paper/2606.02355/citation-record.json","paper":"/paper/2606.02355"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:207eaf982458054fb4c85a25e62c75ca28b2c83c77c05b688aaa87e1b15e1d86","observation_id":"d7c3edcb-85a9-4a69-986e-7df18891d504","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:ef11bc11195c3f1b64c68919cd6ee1e483a2f04cb68b5b2d9a1b6961e6d86939","observation_id":"f85de3f7-2069-4e57-a1ac-c69ce3ca98f4","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2234.322243","doi":"10.1145/322234.322243","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chandra and Dexter C","venue":"Journal of the ACM","work_id":"c3270592-bd69-4213-95e1-4aaf8312be9b","year":1981},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:9c955de5bdf68d4f6bda4747e41b2492710a52d7b3afef0cfd37a9f8d7cdb5c2","observation_id":"5787217c-216d-4f65-806d-db646afb91c5","resolution":{"observed_at":"2026-06-28T14:42:18.091135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:ed43a01e361555a63524ab31125d746a173dfcb82a144e0594cd7b96a3025372","observation_id":"de959fcc-80c6-4cc3-b73f-2844d00fc798","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:0242ab138481b5ee863098def16129b1346a893860a1a996c5cab7ade1e29c35","observation_id":"23b150b9-93d5-499b-a65b-2b0d6c573242","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:2c1862976d8270980a2ca8974cbec7f2141456c291df5fb44c2fbf70d7ad80d8","observation_id":"51c9992b-4ebe-493d-a516-7cb1b015b2b1","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:e901cbb7ead19d0636564ae2bd48e38ecddc8a6065044bd1f3439ad6bcf7ce07","observation_id":"4f67183c-b721-4e5f-96f2-f28423392952","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-07-06T22:45:05.823859Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2602.08234","doi":"10.48550/arxiv.2602.08234","metadata_source":"pith","pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","venue":"cs.LG","work_id":"536a9d0a-baed-4eb9-9a51-f2b585c3388b","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:0557d1956488219f4eb82d7b32b82c415830116ea1a92e58fe8e1247dddc1686","observation_id":"3e420bb1-fd22-4df5-b64c-bd3c5788ae74","resolution":{"observed_at":"2026-07-01T23:16:23.940397Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28716","last_updated":"2026-05-25T12:19:13Z","snapshot_observed_at":"2026-08-07T11:56:06.947334Z","submitted_at":"2026-03-30T17:32:11Z","title":"Dynamic Dual-Granularity Skill Bank for Agentic RL","version":2},"cited_work":{"arxiv_id":"2603.28716","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.28716","snapshot_observed_at":"2026-07-03T18:18:49.838141Z","title":"arXiv preprint arXiv:2603.28716 , year =","venue":"cs.AI","work_id":"6ce82f8a-a849-4330-a0b8-f4c29225e5ce","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2603.28716","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:2520896eb6df4b1d4e2b753c314506603633e667c90c8569529b0ef16dfbab08","observation_id":"24cbd096-6109-4bb2-9f40-25890e9e900d","resolution":{"observed_at":"2026-07-01T23:16:23.883568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2604.10674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-07-04T13:39:50.103028Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","venue":"cs.LG","work_id":"97dc38ac-2adb-4aaa-9fa4-16929254604e","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:307740975a7fef1458858aa56dd891cc220a06d7362924acf356a65845dcb29b","observation_id":"ea0ff959-6359-41b4-8645-9ec4e6f7bc0f","resolution":{"observed_at":"2026-07-01T23:16:23.889061Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:59:25.150542Z","title":"Arise: Agent reasoning with intrinsic skill evolution in hierarchical reinforcement learning","venue":null,"work_id":"52383da6-019e-47d5-8f82-f096957956f3","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:27916758d39fd81dee54194b37d3ffab23e0ef4acfc5f1142dabc39d0621dbcc","observation_id":"00affdbf-b378-48f0-a1a9-3c7d616ce018","resolution":{"observed_at":"2026-07-01T23:16:23.898373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.16291","doi":"10.18653/v1/2023.emnlp-main.118","metadata_source":"pith","pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","venue":"cs.AI","work_id":"ffe0d207-86cf-4742-a100-e988ac8b9676","year":2023},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:8e42aca54df18ca6cc317ac20583f885c608b9b57ee87740fd2a2d45e2ce77fe","observation_id":"042e0ba2-0df4-40ae-87c8-2083ffa7034b","resolution":{"observed_at":"2026-07-01T23:16:23.901767Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:3566a29e099c013f06356b9f3936f717c171b4fe1d1c49f4b1ded500987238b3","observation_id":"1fa1e855-6224-4b7b-a3dc-ac1b4fa03c0d","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:01df3c3ce63b89e531c72c6006d7af7068f4ef42cfef96553bb0701a8caaa5f0","observation_id":"afe4a27f-2d1d-4260-9714-9a8e970d022e","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:16f6e9f25ab729419f31d88bd3e9c9361ef051341f7bc2e6d76dad1781f1324d","observation_id":"b9bfeafb-591e-4ae8-8461-5c63fa65ed0f","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:c2dd80dba011f6ee0b855b4b38a5084ab334fb580adb679ef9a96eac58a5e889","observation_id":"6ea5c6d2-e63d-4371-85e8-41be3235031e","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18901","last_updated":"2024-07-26T17:55:45Z","snapshot_observed_at":"2026-08-01T20:19:05.798018Z","submitted_at":"2024-07-26T17:55:45Z","title":"AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents","version":1},"cited_work":{"arxiv_id":"2407.18901","doi":"10.48550/arxiv.2407.18901","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trivedi, T","venue":"arXiv (Cornell University)","work_id":"569b9cac-ae96-4656-ab37-26520d82ce78","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2407.18901","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:57c5749af2a763f5b9f7e9a5e58c4b6347f812db42cd59a5f0c07316cd6334d0","observation_id":"583d742e-a60d-475f-aa98-435e268757e2","resolution":{"observed_at":"2026-07-01T23:16:23.895486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:ba0d0cbe199ebb2705a8eb7de7cc53d670662d5e3969468ca5fccadc3c1915fa","observation_id":"373e9909-1ed6-4f11-81be-f901b1e7e36d","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:b2e8798d5848ad900161810b080284121d63fe9ca8ff73a0e9488af74eb60234","observation_id":"9995315c-f420-4a84-b9bd-b3cf5ecc40e3","resolution":{"observed_at":"2026-07-01T23:16:23.892126Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.743354Z","title":"Tree search for llm agent reinforcement learning","venue":null,"work_id":"69c0b47c-2fb7-417a-8ff3-444cc4a56703","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:a1bf5ba62bd7f4dd6a4086429289e5c7f54a028f40b215d46192947de2cfa318","observation_id":"65cb10c8-1ace-4f2f-a748-6600542717ee","resolution":{"observed_at":"2026-07-01T23:16:23.923897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:4424a161b24de92e523b73eabfa8ce0917303192790a72ff80646846c378a99f","observation_id":"2fdd18d3-aac2-43fc-a2a2-7cb9aad31500","resolution":{"observed_at":"2026-07-01T23:16:23.874286Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08754","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.657782Z","title":"arXiv preprint arXiv:2603.08754 , year=","venue":null,"work_id":"49010963-6701-44ce-81c9-fd216914feec","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:33872fb6e38bebb8b3b45ca461389fc8b0d05a5887a73a49fade5471457572bf","observation_id":"24f30cd9-5e82-445f-9802-4b69b2865469","resolution":{"observed_at":"2026-07-01T23:16:23.926830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:56.903304Z","title":"arXiv preprint arXiv:2603.03078 , year=","venue":null,"work_id":"96762527-c0b0-4a62-aefe-86a1bae61514","year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:2abde9139fba526ccc42eb7d04fe4327e5dc56ddcfc874ab2ac0e05dd9435094","observation_id":"2af2748a-b2ed-4162-9698-d1db558cb154","resolution":{"observed_at":"2026-07-01T23:16:23.937032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:85fc807f759dace034c74898f5db68733df56132dd8f57551a7a7b613650b666","observation_id":"95c90cbf-0e8c-4441-b627-c857aa5d77a3","resolution":{"observed_at":"2026-07-01T23:16:23.933497Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03192","last_updated":"2026-02-12T05:43:57Z","snapshot_observed_at":"2026-08-02T21:01:18.325722Z","submitted_at":"2026-01-06T17:14:50Z","title":"MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory","version":2},"cited_work":{"arxiv_id":"2601.03192","doi":"10.48550/arxiv.2601.03192","metadata_source":"pith","pith_arxiv_id":"2601.03192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory","venue":"cs.CL","work_id":"0ab11b49-e934-49e1-9eaf-a25fb7343010","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2601.03192","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:479b3610b766ea28416ea2fceacc54722802c736d7374b29e51857a36753f06e","observation_id":"4b69b58f-aa39-40de-b262-02a844b3d7b3","resolution":{"observed_at":"2026-07-01T23:16:23.947110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16079","last_updated":"2026-05-16T02:57:47Z","snapshot_observed_at":"2026-08-05T00:54:36.690304Z","submitted_at":"2025-10-17T12:03:16Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","version":3},"cited_work":{"arxiv_id":"2510.16079","doi":"10.48550/arxiv.2510.16079","metadata_source":"pith","pith_arxiv_id":"2510.16079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","venue":"cs.CL","work_id":"350af93c-7749-4477-8163-e35d2cac8d96","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2510.16079","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:92dce0f804cf60ad49dbd31f059077a5151bcfeb8d00c28b0cc9842b0403e90b","observation_id":"d501a210-3cb5-405f-bff5-42b65864e08f","resolution":{"observed_at":"2026-07-01T23:16:23.957095Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02553","last_updated":"2026-01-29T15:45:24Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-05T21:02:49Z","title":"SimpleMem: Efficient Lifelong Memory for LLM Agents","version":3},"cited_work":{"arxiv_id":"2601.02553","doi":"10.48550/arxiv.2601.02553","metadata_source":"pith","pith_arxiv_id":"2601.02553","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleMem: Efficient Lifelong Memory for LLM Agents","venue":"cs.AI","work_id":"9b5b2649-8727-425e-a2c5-60f49518a5c4","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2601.02553","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:f329ba655591cf05697ba1994ba705862b765521219ed8de481f129dc68a71a1","observation_id":"83b74d42-2047-4d3b-8f56-9c42c8448584","resolution":{"observed_at":"2026-07-01T23:16:23.886381Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19413","last_updated":"2025-04-28T01:46:35Z","snapshot_observed_at":"2026-08-02T07:32:11.339534Z","submitted_at":"2025-04-28T01:46:35Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory","version":1},"cited_work":{"arxiv_id":"2504.19413","doi":"10.48550/arxiv.2504.19413","metadata_source":"pith","pith_arxiv_id":"2504.19413","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory","venue":"cs.CL","work_id":"a5aed26c-a248-48b6-a59e-f7693fcb180a","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2504.19413","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:410f42a7c7b40328738bc53b69f3bd6620b8965b8d11171284f5a9f55d6ae95e","observation_id":"55396aae-7a40-42cb-bfd7-0718b1fea377","resolution":{"observed_at":"2026-07-01T23:16:23.877335Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:ff0f06b722fa8520326f9d30b7230e357eb769d8ae9c0f50f07f797e71064d59","observation_id":"b0552a8d-3632-4538-96ea-8e02ce667168","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:66038dd22f19fa9a74ee16a6c8278ab4e01196cb2518a09648b735f3277a4ccb","observation_id":"c3f5b415-4c40-4d00-a53f-729b798fb1ed","resolution":{"observed_at":"2026-07-01T23:16:23.904757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:a5379de9c1f7e4aebc7f8600ebedf2bd6cc2296d74a7ba7faf949e1233735b2f","observation_id":"567f7c6c-6417-4799-8242-3ce7723d3ab8","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:ba5754d9e15aeb5d491f5f460b5ea6c3859cccb17ba22a4adb241db7080c9b58","observation_id":"3b8ec7d5-0b75-4e95-87f4-518b8a547c21","resolution":{"observed_at":"2026-07-01T23:16:23.880437Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:11541ab4f5dfa07ca45dc7e6431bff5b791a6d327dddaaefde808a5b3a5de6bb","observation_id":"5d8d7ca4-61ad-4787-9cb2-05c8e7a187d1","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:2e2d7e820a76339fa87cfaeb13674d603f68af8702ad0216414b7b144b157b8b","observation_id":"4e8dbb42-a2ff-4e2a-b88c-001e7d34f15d","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:41f5f3d064f33dfea321fc368e70229f7c07fa2a2540dd38c1a3cdd504f27906","observation_id":"38b6f1c7-a6f1-429c-b5cf-0c0208c01539","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:0be4b483abe5fa5165bd72109e6186784301d1bf78f9f5cd255663b09323cc5f","observation_id":"0101eaa4-0d34-442b-bd2d-57357d55f2e1","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:42caaa5b1709fb532746c8427c2941166d4fe4b67f60303d0ff67aedd37f87da","observation_id":"6638e893-ea36-4086-aeff-aafae6be1d09","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-05T01:30:13.153471Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:44dce153726edf2f4726134ea476c8e4959da378a550a9673918c75386156794","observation_id":"e73b26fe-012c-41a7-8cf0-a8486627ae88","resolution":{"observed_at":"2026-07-01T23:16:23.950721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":"2408.07199","doi":"10.48550/arxiv.2408.07199","metadata_source":"pith","pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","venue":"cs.AI","work_id":"af60de99-112e-4dda-bc6b-5ec7381cfaad","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:4b7acca715394357106821595a3bf95180bf1a65119b229776b5e91a20c37ca1","observation_id":"6759baf3-9ac4-4d18-a34a-0ade98708a39","resolution":{"observed_at":"2026-07-01T23:16:23.954039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03792","last_updated":"2025-06-03T12:14:42Z","snapshot_observed_at":"2026-08-07T15:57:22.379010Z","submitted_at":"2025-05-01T14:17:53Z","title":"Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.03792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.03792","snapshot_observed_at":"2026-07-02T12:16:56.911098Z","title":"arXiv preprint arXiv:2505.03792 , year=","venue":null,"work_id":"a011737c-856f-48d9-ab1d-698e0fe83352","year":null},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2505.03792","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:7e51bf876ac8e287e6ad5091d48673826c94481ace7973a4334121ba70d66120","observation_id":"e0c6c9f2-3dda-46d5-8b59-7eb88bd81ba9","resolution":{"observed_at":"2026-07-01T23:16:23.920593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-07-06T20:30:26.881629Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":"2502.01600","doi":"10.48550/arxiv.2502.01600","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning for long-horizon interactive llm agents","venue":"ArXiv.org","work_id":"7e929792-6a2a-42ff-a1db-763f890d8b4e","year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:14957030ffc96067ef462ad6ccd4b7c05c432c8d48a76643929371d49fd16a30","observation_id":"2e23d26e-160b-4cee-8734-d8aaf6893079","resolution":{"observed_at":"2026-07-01T23:16:23.914071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:3f0181a9e4f58e20e5300de6c2b915a4ff7d4a395fe2617d47a2a8bd1a384e80","observation_id":"0bff4fa0-2046-4936-924d-e42815f36a12","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09459","last_updated":"2026-04-13T12:08:22Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":"2604.09459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09459","snapshot_observed_at":"2026-07-09T11:16:11.379473Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"b28c3265-685a-4be5-b6e3-cfcd46733d99","year":2026},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2604.09459","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:08ac1e59441a6613cc5bacedfb608744aa7bafe3808e061f5147158162f62a4e","observation_id":"0e8916c8-2fc7-468c-b68b-306bb611548d","resolution":{"observed_at":"2026-07-01T23:16:23.917364Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-06T05:10:41.210993Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2312.01072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-07-04T17:40:00.280883Z","title":"A survey of temporal credit assignment in deep reinforcement learning","venue":null,"work_id":"974bd811-fce0-4e67-ae9d-697f5f35a1e8","year":2023},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:8523f485e1f31e2280bf63a2341786bffb656306f46e9da4c87c321572351a83","observation_id":"d757079b-5053-4254-a5e2-deba08a82383","resolution":{"observed_at":"2026-07-01T23:16:23.930228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T14:33:00.408984Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:6edd5164d7f7a853657d7acfe27f3832aa48a9471ae0a516103e9180c5886e59","observation_id":"b1d74dbb-ec2c-4ebe-8bd7-71095a4027d2","resolution":{"observed_at":"2026-06-28T14:33:00.408984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.07679","last_updated":"2016-04-04T11:27:36Z","snapshot_observed_at":"2026-08-03T08:37:56.722087Z","submitted_at":"2015-12-24T01:31:40Z","title":"Deep Reinforcement Learning in Large Discrete Action Spaces","version":2},"cited_work":{"arxiv_id":"1512.07679","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.07679","snapshot_observed_at":"2026-07-03T06:57:42.649235Z","title":"Deep Reinforcement Learning in Large Discrete Action Spaces","venue":"cs.AI","work_id":"31160991-9d38-4671-9189-9fb12ba0f055","year":2015},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/1512.07679","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:67b746c0ef232da6c921966e9f3736809feae969f90a1ebb6f9f790423770ac3","observation_id":"f3a9b7c5-7764-4e36-aac8-39a7f268ae5b","resolution":{"observed_at":"2026-07-01T23:16:23.943730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:c1eb0cf13c636fdd2a6d745d7d7a37161250273e86de3a73c1e5b8cb50735b12","observation_id":"6b95f177-45a9-479a-bd6b-1707712d481d","resolution":{"observed_at":"2026-07-01T23:16:23.910869Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:fd4e8ce0973f36d5b1500b2b1e461bbbb867edd8858824199d5e3fb509a8c691","observation_id":"453b1ca1-d603-4e5f-bc28-0ff5c8f192a8","resolution":{"observed_at":"2026-07-01T23:16:23.907962Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":23,"parse_uncertain":0,"unresolved":20,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2606.02355."}