{"as_of":"2026-08-07T16:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a01790a2f4415137e937b49df7b794fdecfb697c5ef3fc2f155ed16ba547b5e","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:48:07.210826Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09973/citation-record","integrity":"/paper/2507.09973/integrity","json":"/paper/2507.09973/citation-record.json","paper":"/paper/2507.09973"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.089065Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.089065Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3dbd3d98d1928b272fcca9f9fcaf558af5cfb7d22c225098cf00bf525c31e922","observation_id":"bb79d5da-4c7a-40e6-b4d7-0ed61c769ad0","resolution":{"observed_at":"2026-08-06T17:48:07.089065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T17:48:07.092692Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.092692Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:679568f0cd25d85ad9b639578274598fc0b882f01000b9e5fa0eccac815a2cea","observation_id":"5a83696c-c906-427c-90cf-c33df3bad179","resolution":{"observed_at":"2026-08-06T17:48:07.092692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13582","last_updated":"2022-05-04T08:55:21Z","snapshot_observed_at":"2026-08-07T03:10:36.093139Z","submitted_at":"2021-09-28T09:29:15Z","title":"PPL-MCTS: Constrained Textual Generation Through Discriminator-Guided MCTS Decoding","version":2},"cited_work":{"arxiv_id":"2109.13582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13582","snapshot_observed_at":"2026-08-06T17:48:07.692079Z","title":"PPL-MCTS: Constrained Textual Generation Through Discriminator-Guided MCTS Decoding","venue":"cs.CL","work_id":"b7280d65-6962-4ff0-ac57-5e8e3166dc97","year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.095711Z"},"links":{"cited_paper":"/paper/2109.13582","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:be3025bd268ae2404e7e018f21d91a1e6875a479bcc23ecd80978ed0b774c84a","observation_id":"9fc9e5de-1c04-4e9a-8616-6d0672d9b7d1","resolution":{"observed_at":"2026-08-06T17:48:07.695107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.098573Z","title":"Rm-r1: Reward modeling as reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.098573Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:82a8a4cc837bc5de528b8d8e92b954c312355872a170f597a2a6c22cc6454046","observation_id":"86b77f26-9ca0-4d57-8d65-8bcf86e0ee1e","resolution":{"observed_at":"2026-08-06T17:48:07.098573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.716040Z","title":"B., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":"b323c98d-6c37-4d5d-a1e3-758a6d8ccf00","year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.101195Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:b3271dd28deae662b592f85b770fef5cdf41a39ebde5bfe934d3caef368248dd","observation_id":"8b4b6dfb-eff9-41c9-a1a2-99a9b1cd50b8","resolution":{"observed_at":"2026-08-06T17:48:07.718376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-06T17:48:07.103616Z","title":"W., Hou, L., Longpre, S., Zoph, B., Tay, Y., Fedus, W., Li, Y., Wang, X., Dehghani, M., Brahma, S., Webson, A., Gu, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.103616Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:aca159b0f00471a4916de6fb83dfe8f3e760544ed2a3c546bdcc014063d66d73","observation_id":"5027851b-45cc-41f4-9282-970a71d218c4","resolution":{"observed_at":"2026-08-06T17:48:07.103616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03793","last_updated":"2025-02-10T14:08:19Z","snapshot_observed_at":"2026-08-07T03:09:58.440235Z","submitted_at":"2025-02-06T05:47:37Z","title":"It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers","version":2},"cited_work":{"arxiv_id":"2502.03793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03793","snapshot_observed_at":"2026-08-06T17:48:07.604735Z","title":"It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers","venue":"cs.CL","work_id":"5090f212-7232-44a1-a561-154aabfaf56b","year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.106359Z"},"links":{"cited_paper":"/paper/2502.03793","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:b5aeff67ab481e9a060649f3598189b85a5e4be6505dca9722b7b1f5650c3315","observation_id":"f86633c8-6b4d-4265-b4bc-f7dbf11bcbe6","resolution":{"observed_at":"2026-08-06T17:48:07.607922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:48:07.109354Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.109354Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:5095ae392e238909bcf3d7e118417af499f1816494724e03aab0d13b687a315e","observation_id":"c0138e18-c753-41df-a667-1b813b9a507e","resolution":{"observed_at":"2026-08-06T17:48:07.109354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-06T17:48:07.111658Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.111658Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:3d6b35ee413f435ec0306318b51983bbdd327c51b73be52c094839ceb3b5b856","observation_id":"7ffd1b75-1817-4897-87f9-9b0a4fe3efaa","resolution":{"observed_at":"2026-08-06T17:48:07.111658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.707989Z","title":"L., and Vigliocco, G","venue":null,"work_id":"c910854f-916b-44ae-aa7c-63a8ee96da1a","year":2012},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.114627Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f8ebe9152c43f6f9a8da11db84692edf162c304bbd78c647e9810088c1f0506b","observation_id":"f98dd840-a992-4e95-b9f3-932fd9983cac","resolution":{"observed_at":"2026-08-06T17:48:07.710863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-06T17:48:07.117097Z","title":"Scaling laws for reward model overoptimization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.117097Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:9ec76d70d36665db7b34772ffd9daf5b1a64d8c847d808951646594ade623624","observation_id":"17de84cb-7b24-49a6-ae43-762183081e98","resolution":{"observed_at":"2026-08-06T17:48:07.117097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.119680Z","title":"Making pre-trained language models better few-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.119680Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:35253b0b0a5f21d153176b8f72cc14fd38c6a6197e3ccad4564bf1253a94afa1","observation_id":"07f91a81-d6f9-4dca-9acd-b5e61a593cd5","resolution":{"observed_at":"2026-08-06T17:48:07.119680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04611","last_updated":"2025-03-06T16:57:26Z","snapshot_observed_at":"2026-07-06T20:48:00.573883Z","submitted_at":"2025-03-06T16:57:26Z","title":"Towards Data-Efficient Language Models: A Child-Inspired Approach to Language Learning","version":1},"cited_work":{"arxiv_id":"2503.04611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.04611","snapshot_observed_at":"2026-08-06T17:48:07.572329Z","title":"Towards Data-Efficient Language Models: A Child-Inspired Approach to Language Learning","venue":"cs.CL","work_id":"8dcd22fa-e01c-45dd-87f9-32d16a733652","year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.122038Z"},"links":{"cited_paper":"/paper/2503.04611","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:effdc00bd1efa03f7d58f57a9055e963dadf6d95fb52c3e7374ab1abb92c6141","observation_id":"02458464-c5a9-4475-8514-9a64609c1b63","resolution":{"observed_at":"2026-08-06T17:48:07.575213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:48:07.124633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.124633Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7806cf637672fdc61e05755b5b634b4260c313649ca4311b77fb00b4b03909fb","observation_id":"80c8c4af-44f5-4f4f-8a0c-f6eb2c026317","resolution":{"observed_at":"2026-08-06T17:48:07.124633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T17:48:07.127115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.127115Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7810c18c99400386010bb0f10f2ac824ff85a91c8734e1a34cfd794b4eac6803","observation_id":"c11d3822-6db0-494b-a4f7-02e261dfed68","resolution":{"observed_at":"2026-08-06T17:48:07.127115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06000","last_updated":"2024-12-08T17:19:48Z","snapshot_observed_at":"2026-07-06T20:03:29.510169Z","submitted_at":"2024-12-08T17:19:48Z","title":"Does RLHF Scale? Exploring the Impacts From Data, Model, and Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06000","snapshot_observed_at":"2026-08-06T17:48:07.129543Z","title":"Does rlhf scale? exploring the impacts from data, model, and method, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.129543Z"},"links":{"cited_paper":"/paper/2412.06000","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7ab7c4e657801bfeb1352f7adae6e9a99c7e564c95d8b79f893d84ed50c9b8c2","observation_id":"a15d9dde-7f19-4637-a4f5-ecb0c0c58b8e","resolution":{"observed_at":"2026-08-06T17:48:07.129543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-06T18:01:48.915710Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-06T17:48:07.131920Z","title":"and Ruder, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.131920Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:4e3973b871315ef5fe3f21d1f4159dfb610f61009bafdb506327bddcc8ff2c22","observation_id":"841364ec-0573-4c03-a26a-f6ec90b140b8","resolution":{"observed_at":"2026-08-06T17:48:07.131920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T17:48:07.134619Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.134619Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f35473c685bf9bfb31e1e0842e703cd0c097b4d1d118d4985c9dc3dbb0f9c2ea","observation_id":"db601eee-593a-4c61-a1d8-3d38dfbc423c","resolution":{"observed_at":"2026-08-06T17:48:07.134619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-06T17:48:07.137146Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.137146Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:c45f728d693dd0787942ec417f731e03e1715fde6e021051d8a4dece112d42fa","observation_id":"42fe3188-5383-423d-b63f-299496c0b3a7","resolution":{"observed_at":"2026-08-06T17:48:07.137146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-06T15:18:02.072435Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-06T17:48:07.139475Z","title":"M., Stanley, O., Nagyfi, R., ES, S., Suri, S., Glushkov, D., Dantuluri, A., Maguire, A., Schuhmann, C., Nguyen, H., and Mattick, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.139475Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:c195f0095613339c80576bd95018ca3b63b8ed28f041e5634ad43778d80ef3d2","observation_id":"53dde41c-fc6c-4f35-97a7-5e515f38a3fa","resolution":{"observed_at":"2026-08-06T17:48:07.139475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T17:48:07.141889Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., Smith, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.141889Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:b14ea57f9752167eb64549f48a51121593f16d0ef36eee28d94cad4c13beb75e","observation_id":"459455e7-a116-4b41-a7fc-2cb1cfac5cc5","resolution":{"observed_at":"2026-08-06T17:48:07.141889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03090","last_updated":"2019-11-08T07:05:20Z","snapshot_observed_at":"2026-07-06T08:35:28.740170Z","submitted_at":"2019-11-08T07:05:20Z","title":"What Would Elsa Do? Freezing Layers During Transformer Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03090","snapshot_observed_at":"2026-08-06T17:48:07.144511Z","title":"What would elsa do? freezing layers during transformer fine-tuning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.144511Z"},"links":{"cited_paper":"/paper/1911.03090","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7a8f70912f536992bf205d0efb2d92d7899b9986a052a0cfe4461e09b78075ad","observation_id":"8156c2eb-62bd-4796-9ebe-ca1460e7ab41","resolution":{"observed_at":"2026-08-06T17:48:07.144511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-06T17:48:07.146902Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.146902Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:0302daf5c90177b17c6e7820d897b364d8de4b49d2ba43ae79d92a22f923ae82","observation_id":"8e9201f9-ecad-4092-8e74-1c7c14d616c4","resolution":{"observed_at":"2026-08-06T17:48:07.146902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-06T17:48:07.149469Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.149469Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:05d2587a612a5db777ca66168c5128dbb3613ee1541d616eea5c800e2814766b","observation_id":"5a54112a-3525-44c0-9a96-08ef27a9f9dc","resolution":{"observed_at":"2026-08-06T17:48:07.149469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T17:48:07.152003Z","title":"Let's verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.152003Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:4644883bfbf2931f81189ef130d8e653ecef580df163cdec6f87f177777c0ff7","observation_id":"34cc45f9-ca75-409f-9df3-578986314c80","resolution":{"observed_at":"2026-08-06T17:48:07.152003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T17:48:07.154579Z","title":"Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.154579Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:b8edcfe31bd8eaa426908e45fef3c890a7b108fe2236be622b28388d39a612ac","observation_id":"e99e856f-6e33-4b1c-817e-67625d4bcaca","resolution":{"observed_at":"2026-08-06T17:48:07.154579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-06T17:48:07.157051Z","title":"F., Cheng, K.-T., and Chen, M.-H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.157051Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:95ac0fdba5a53a076b1be47aa63e6ef1bf16b1488b13e917904d682608d87234","observation_id":"8c8ae2a7-6cf2-4a81-9f5d-2416827e6c61","resolution":{"observed_at":"2026-08-06T17:48:07.157051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-06T17:48:07.159727Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.159727Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:aa6f0a43284d74258c090610884c2252898a4dc1201571c8961b88f835da5dd5","observation_id":"e8578aff-60bd-4b87-a2f6-fbdf9c4f6b1c","resolution":{"observed_at":"2026-08-06T17:48:07.159727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T17:48:07.162023Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.162023Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:ee84508314557414922b66da528262782de9585db0638b8639934ed4a4da3412","observation_id":"7cb9e172-efc3-4fa9-932a-ea5822a66474","resolution":{"observed_at":"2026-08-06T17:48:07.162023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T17:48:07.164185Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.164185Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:214b1b0a222b0cb17245508ea91a58930ca621ce096381ae3b4c76cac616831d","observation_id":"f02cbb16-bc9d-4043-8623-29554abc7501","resolution":{"observed_at":"2026-08-06T17:48:07.164185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04085","last_updated":"2020-04-14T14:57:40Z","snapshot_observed_at":"2026-08-02T11:18:37.014004Z","submitted_at":"2019-01-13T23:27:58Z","title":"Passage Re-ranking with BERT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04085","snapshot_observed_at":"2026-08-06T17:48:07.166590Z","title":"and Cho, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.166590Z"},"links":{"cited_paper":"/paper/1901.04085","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d09b177ea47569a799eab7e8af5f3fa1633c11f0b72a05ce06d8bd33862aef04","observation_id":"3279575f-3339-45b6-9782-4f22b9fa39ce","resolution":{"observed_at":"2026-08-06T17:48:07.166590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T17:48:07.168990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.168990Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:2bca1fdaefba5af947bdc21e75f8679d9aeb18b00527fdc75fd1d5b4ed46e163","observation_id":"57c0428d-05be-40a2-bc31-aae00aa506bc","resolution":{"observed_at":"2026-08-06T17:48:07.168990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T17:48:07.171387Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.171387Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:1d186f71379387e56005e81f45720085e7d50e9d49811976c595fe1af2f8051d","observation_id":"6a490881-e7e0-4992-9191-c5b2b4fd2089","resolution":{"observed_at":"2026-08-06T17:48:07.171387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05821","last_updated":"2023-11-10T01:35:51Z","snapshot_observed_at":"2026-08-05T06:22:39.770127Z","submitted_at":"2023-11-10T01:35:51Z","title":"Let's Reinforce Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05821","snapshot_observed_at":"2026-08-06T17:48:07.173925Z","title":"Let's reinforce step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.173925Z"},"links":{"cited_paper":"/paper/2311.05821","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:dc5ad396ec38c84a5052c6737c14a6ee8e3ef36b92ca77d9294d1e4b779ba395","observation_id":"7a8c7288-d584-4bb4-95e9-f3b0ba4fb327","resolution":{"observed_at":"2026-08-06T17:48:07.173925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-06T17:48:07.176314Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.176314Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:522d678ab54f2dc35b3ad55979ba64312403159ce5335969ae291f5df7352e3c","observation_id":"af90b18e-5bee-4183-85a5-62a94e9b2624","resolution":{"observed_at":"2026-08-06T17:48:07.176314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-07-30T18:16:51.527587Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T17:48:07.178654Z","title":"Warm: On the benefits of weight averaged reward models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.178654Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f1bf831258ba9258c23f56e15ad849b99cd9d86ab4840826d37c326a5e763909","observation_id":"c96758dd-57fc-40a8-9c3f-1eaab651fd41","resolution":{"observed_at":"2026-08-06T17:48:07.178654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04823","last_updated":"2024-10-31T16:48:51Z","snapshot_observed_at":"2026-07-06T18:27:03.044022Z","submitted_at":"2024-06-07T10:48:45Z","title":"BERTs are Generative In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04823","snapshot_observed_at":"2026-08-06T17:48:07.181168Z","title":"Berts are generative in-context learners, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.181168Z"},"links":{"cited_paper":"/paper/2406.04823","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:9e2a9649509cc57e9ad81d3594247b2c3e5b4368a2ab894f18920c52dd196b57","observation_id":"e265842c-7e61-40cc-afc5-6409dd85f99f","resolution":{"observed_at":"2026-08-06T17:48:07.181168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07676","last_updated":"2021-01-25T10:56:45Z","snapshot_observed_at":"2026-08-07T14:12:26.620672Z","submitted_at":"2020-01-21T17:57:33Z","title":"Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07676","snapshot_observed_at":"2026-08-06T17:48:07.183516Z","title":"and Schütze, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.183516Z"},"links":{"cited_paper":"/paper/2001.07676","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:ca86507bae518a4ea5bef0883e6a036795f0cb62b95f13401c3fa7d60b3efb6c","observation_id":"55c7ffa2-a916-4d5a-9f42-37c62c029a48","resolution":{"observed_at":"2026-08-06T17:48:07.183516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07118","last_updated":"2021-04-12T08:16:59Z","snapshot_observed_at":"2026-08-05T04:33:26.758046Z","submitted_at":"2020-09-15T14:18:53Z","title":"It's Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07118","snapshot_observed_at":"2026-08-06T17:48:07.185809Z","title":"and Schütze, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.185809Z"},"links":{"cited_paper":"/paper/2009.07118","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:bdb43c5038127a98b1ba0d25b1e71649073c277bec7eac24570999ba38c22c35","observation_id":"abb3c454-889b-487e-9e31-95e36072bc82","resolution":{"observed_at":"2026-08-06T17:48:07.185809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16155","last_updated":"2023-09-28T04:05:13Z","snapshot_observed_at":"2026-08-02T03:33:25.183604Z","submitted_at":"2023-09-28T04:05:13Z","title":"The Trickle-down Impact of Reward (In-)consistency on RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16155","snapshot_observed_at":"2026-08-06T17:48:07.188338Z","title":"The trickle-down impact of reward (in-)consistency on rlhf, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.188338Z"},"links":{"cited_paper":"/paper/2309.16155","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:7797a61e6215c2252bf75af592d0769f3ccaf0c2551c4039e66756726745a5f8","observation_id":"2237a1c5-ba21-4367-b8f6-dc294cd7fbbc","resolution":{"observed_at":"2026-08-06T17:48:07.188338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-06T17:48:07.190751Z","title":"R., Zhao, D., Patel, N., Naghiyev, J., LeCun, Y., and Shwartz-Ziv, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.190751Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:93d60e65feaf148d731c7e02e54c30fb663c90b749b67a1a7db5a94d46d28c26","observation_id":"986bf3e7-c475-4689-8ffb-a0a7508a53d1","resolution":{"observed_at":"2026-08-06T17:48:07.190751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:48:07.193757Z","title":"D., and Su, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.193757Z"},"links":{"citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d3ec0937eaf0c1a26edfbdab84ecd6d25f44792d3ab8daaf2f72c2e770efea7b","observation_id":"60319909-5b82-4069-bfa0-023280b205c8","resolution":{"observed_at":"2026-08-06T17:48:07.193757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04547","last_updated":"2023-11-08T09:26:27Z","snapshot_observed_at":"2026-08-04T16:55:55.933440Z","submitted_at":"2023-11-08T09:26:27Z","title":"Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures","version":1},"cited_work":{"arxiv_id":"2311.04547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04547","snapshot_observed_at":"2026-08-06T17:48:07.280836Z","title":"Large GPT-like Models are Bad Babies: A Closer Look at the Relationship between Linguistic Competence and Psycholinguistic Measures","venue":"cs.CL","work_id":"89eb2071-1a8f-4384-b884-7b929b87f340","year":2023},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.196004Z"},"links":{"cited_paper":"/paper/2311.04547","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:4574f4666335fd9c72926700cd3bc4414aaac5223aa2884d7049564c4c40d1de","observation_id":"faba13a6-cc57-4e9c-9c9b-8f8b81993a6d","resolution":{"observed_at":"2026-08-06T17:48:07.285710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05583","last_updated":"2020-02-05T12:00:32Z","snapshot_observed_at":"2026-08-05T17:16:24.754798Z","submitted_at":"2019-05-14T13:17:26Z","title":"How to Fine-Tune BERT for Text Classification?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05583","snapshot_observed_at":"2026-08-06T17:48:07.198467Z","title":"How to fine-tune bert for text classification?, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.198467Z"},"links":{"cited_paper":"/paper/1905.05583","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:25dc8eeeb8f316b19660eb900d0c88cc08a728c7597643e73d43d39d226db884","observation_id":"d63fe4c4-efae-4003-a284-2e58a6e4d6a0","resolution":{"observed_at":"2026-08-06T17:48:07.198467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-06T17:48:07.201291Z","title":"J., Sreedhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.201291Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:5adc1ab7a16fcfd9595961dd76a86cfa9240c8b6064471630aeab2bc4dfadf88","observation_id":"5be4873b-40e3-45a8-896b-91a648f1633d","resolution":{"observed_at":"2026-08-06T17:48:07.201291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-06T17:48:07.203840Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.203840Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:086e679232bb922daf486744e9bfec184c90c986880e6b227d6b47d43d41848a","observation_id":"79311ea0-1930-4be7-87c8-9a9fc00b6d25","resolution":{"observed_at":"2026-08-06T17:48:07.203840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T17:48:07.206091Z","title":"Y., Guu, K., Yu, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.206091Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f7b8cbbddd430a8e91ecd3351d53060dae16db912275606c24ad422d9290b6b3","observation_id":"de32fa4b-0030-450f-a9c6-4897c78b760c","resolution":{"observed_at":"2026-08-06T17:48:07.206091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02381","last_updated":"2025-02-28T23:33:22Z","snapshot_observed_at":"2026-08-04T16:58:26.946941Z","submitted_at":"2024-10-03T11:01:25Z","title":"MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02381","snapshot_observed_at":"2026-08-06T17:48:07.208459Z","title":"I., Anugraha, D., Susanto, L., Kuwanto, G., and Wijaya, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.208459Z"},"links":{"cited_paper":"/paper/2410.02381","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:d54f0ca0269c38952bbd8a639dcae83b1aa24ca157fad428bf4a3826af3cf26b","observation_id":"a71856fb-f940-4e8f-8098-d0b4794b6b94","resolution":{"observed_at":"2026-08-06T17:48:07.208459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1792","last_updated":"2014-11-06T23:09:37Z","snapshot_observed_at":"2026-07-06T03:59:50.543544Z","submitted_at":"2014-11-06T23:09:37Z","title":"How transferable are features in deep neural networks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1792","snapshot_observed_at":"2026-08-06T17:48:07.210826Z","title":"How transferable are features in deep neural networks?, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.210826Z"},"links":{"cited_paper":"/paper/1411.1792","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:95407d730128a39ef3968da9b70928829dfe33f0cc8dac103e10deda3d1cea11","observation_id":"b5ece352-57bb-4918-bb9e-91cd6961c748","resolution":{"observed_at":"2026-08-06T17:48:07.210826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T03:09:27.762286Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2507.09973."}