{"as_of":"2026-08-20T22:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21ccec50a176867d1de6ba6662b73eb7042fef42f9c90dfcb6281b302fc252e4","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:09:46.548746Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.13492/citation-record","integrity":"/paper/2412.13492/integrity","json":"/paper/2412.13492/citation-record.json","paper":"/paper/2412.13492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.857440Z","title":null,"venue":null,"work_id":"fe36bed8-1a8b-40d9-ad2c-03800e2ea6c9","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.476073Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:20eaaae03ef1be845cba6572943a822866a46656869895348d0c183f771b1988","observation_id":"ed7f5a96-23e4-476c-9472-1dbf3302eb33","resolution":{"observed_at":"2026-08-11T13:09:46.863199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.815014Z","title":null,"venue":null,"work_id":"532fc623-e82d-418d-9c10-7b2e50bfd6d6","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.489993Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:5746cca89e738dad65bb68cf7757303c7f6df6967b0eb2bc55602e6ffc3bbab8","observation_id":"15149894-1abf-42a3-8bbc-b56c3608e1b6","resolution":{"observed_at":"2026-08-11T13:09:46.821947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.780357Z","title":"Under no circumstance can you in- troduce new input variables","venue":null,"work_id":"0f7bc4a7-b4e1-49f7-b758-95bb847d35f6","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.497074Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:82c98f92cc75e90ad601330f2ea92460944c411ac8d9a966c5335a07e0742361","observation_id":"17e6cd46-e057-42db-96e0-217da7f9a3af","resolution":{"observed_at":"2026-08-11T13:09:46.787211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.834757Z","title":"Each transformed reward component should have its own temperature variable","venue":null,"work_id":"7c15afda-852a-44d1-a37c-aa2b6ae3d150","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.482494Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:b632f070f3a268717e10f33031424848dc13387fa754e3c4cca93f045c7f9e2b","observation_id":"5acad43c-9f9f-4d8a-88c2-6d4efb5cc494","resolution":{"observed_at":"2026-08-11T13:09:46.842675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.758425Z","title":null,"venue":null,"work_id":"26cd6f61-59cb-4ff4-92a3-e1e0d590cff6","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.504269Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:7cbefcc2c90d2336ec97fe88420d8ea5a6e9126e5518b4aa7c591a3f9b2be0e7","observation_id":"ade6ac28-ae59-4184-9fb1-63855f73ebc2","resolution":{"observed_at":"2026-08-11T13:09:46.765430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.730859Z","title":"You may consider: (a) Changing its scale or the value of its temperature pa- rameter (b) Re-writing the reward component (c) Discarding the reward component","venue":null,"work_id":"8bbd5f97-3806-40ea-b454-216b1eeb5fc1","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.510691Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:1084ff4c21bf9c60a0b4deeb4a4983a31b593486e5153dd9f24a0a2621b9b4aa","observation_id":"d0377722-aeeb-41e6-9960-83f71f4bf7cc","resolution":{"observed_at":"2026-08-11T13:09:46.741325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.699885Z","title":"Please analyze each existing reward component in the sug- gested manner above first, and then write the reward function code","venue":null,"work_id":"ab65bc23-798e-476f-abdb-f8e61f4ef651","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.516657Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:483ea8e81a8ebde47b54b5f05f838a0081c243e31c44ef8a5768c106ccca996a","observation_id":"7d02b0e4-dc15-41d9-8421-0637dc9537db","resolution":{"observed_at":"2026-08-11T13:09:46.706990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.879520Z","title":"‘‘‘python ... ‘‘‘","venue":null,"work_id":"4c0f22bc-ca32-4c9d-a39b-c92d943ef4aa","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.522384Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:c0bbc4191d9af56f66b33f4a201a5e2296c73bf61ab0df4e24987a32a12fd11a","observation_id":"9dc958a7-a338-4c28-bca7-116918188d81","resolution":{"observed_at":"2026-08-11T13:09:46.886098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.674791Z","title":null,"venue":null,"work_id":"8571cd41-1c0a-4000-96a8-f5f021462b20","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.529365Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:a251168512c169123ab0f2d0dce38631fb7d56d13491e2cb3f23afea251cf504","observation_id":"614c3def-6066-4f28-8689-2793cd4614db","resolution":{"observed_at":"2026-08-11T13:09:46.680829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.655662Z","title":"Each transformed reward component should have its own temperature variable","venue":null,"work_id":"3432e564-5db3-485e-b5ff-95d28155009b","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.536082Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:6d39d972ddee60ce91a7ddff5fce275de37b6354eed0f1c3411286d704c30cdb","observation_id":"b3385918-2d74-410d-b0c2-5012f47370f1","resolution":{"observed_at":"2026-08-11T13:09:46.661971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.634295Z","title":null,"venue":null,"work_id":"da5a5af8-0a1e-4862-9ef4-547d4ea7bff0","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.543141Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:bfd588741937f3581126b78c4a7cfee50db7e0ca0c7dbb77285c10e2ba5e45da","observation_id":"a0b0bbf0-220e-41a4-bad2-3dc3705f9644","resolution":{"observed_at":"2026-08-11T13:09:46.640643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.610943Z","title":"Un- der no circumstance can you introduce new input vari- ables","venue":null,"work_id":"d9d4fa9d-50bc-4b76-ae7e-2e60d451c9a6","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.548746Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:de16995f67b8b0209052046297e007996923de38824b4ff50b7ebe910085d7bf","observation_id":"08753ce8-d286-45f5-b2db-041e3dc195e9","resolution":{"observed_at":"2026-08-11T13:09:46.619628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13812","last_updated":"2024-04-09T21:01:56Z","snapshot_observed_at":"2026-08-19T03:56:32.694978Z","submitted_at":"2023-06-23T23:19:21Z","title":"Maintaining Plasticity in Deep Continual Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13812","snapshot_observed_at":"2026-08-11T13:09:46.454679Z","title":"Dohare, S.; Hernandez-Garcia, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":318,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.454679Z"},"links":{"cited_paper":"/paper/2306.13812","citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:65be2b81165baeb72e608e63ea87e6c7e4428ff0303b47790e80968a8a0258af","observation_id":"53867a7a-1d4e-4f45-aff5-9ade45212742","resolution":{"observed_at":"2026-08-11T13:09:46.454679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.901061Z","title":"initial prompt","venue":null,"work_id":"c202d2af-b383-4bb6-80a7-8d82035bbc6d","year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.462121Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:29625162351623348d99f00a019e448043131d5a6b46a88b2b4448fcafd6ef48","observation_id":"64c91e9a-1dba-4cd0-b8a6-fb77167e6ab9","resolution":{"observed_at":"2026-08-11T13:09:46.906425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:09:46.448315Z","title":"In Conference on robot learning, 287–","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:46.448315Z"},"links":{"citing_paper":"/paper/2412.13492"},"observation_digest":"sha256:de4383b9a0b76ad27258cfa7cbf7b5120585d84b2580f8c07fa5074fe195a350","observation_id":"dbae3db7-13b4-4f0a-9134-b85f42e72b46","resolution":{"observed_at":"2026-08-11T13:09:46.448315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13492","last_updated":"2024-12-18T04:20:33Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T07:28:38.067336Z","submitted_at":"2024-12-18T04:20:33Z","title":"Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2412.13492."}