{"as_of":"2026-08-08T21:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:197d06795607fbf2d8854d697eeeb80f691e48ca7640ef33c251952e8efc195c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:09:38.960214Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.09096/citation-record","integrity":"/paper/2506.09096/integrity","json":"/paper/2506.09096/citation-record.json","paper":"/paper/2506.09096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.805612Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"84ee205f-13dc-4474-aa4a-904ce0d8a470","year":2022},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:33.802950Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:911699caa60e0aeb9540dcbaf56ba295029d845fff68d37ec4fc4e0c040d299a","observation_id":"4132a0e4-49f0-476a-91db-a8c37c4f63d7","resolution":{"observed_at":"2026-08-07T05:09:45.831652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.751816Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":"7a31e883-6008-4178-b2fc-58a7b7c110a7","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:33.901900Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:62969570f9b8a882099933fa2f86d21f1a12fe06da7ac4434ff3d0247bf31b78","observation_id":"bec86bc4-369b-4086-b50c-f16b257b9303","resolution":{"observed_at":"2026-08-07T05:09:45.778388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.695244Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"62b260cc-7982-4763-8423-50e0a6877e67","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:33.972354Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:56cf6347f79d16186550c26e5a785fc14772dc045030f6d6a318537fe861f1ff","observation_id":"2fcd8772-3748-4012-983b-cf3ccc1b3c56","resolution":{"observed_at":"2026-08-07T05:09:45.715947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11701","last_updated":"2025-03-12T08:45:15Z","snapshot_observed_at":"2026-08-07T17:10:44.708302Z","submitted_at":"2025-03-12T08:45:15Z","title":"A Survey of Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11701","snapshot_observed_at":"2026-08-07T05:09:34.053645Z","title":"A survey of direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.053645Z"},"links":{"cited_paper":"/paper/2503.11701","citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:5bed71ed01e8479ab41d517f27be16484cc23b4a9d064bf9e1027d6d04c188a8","observation_id":"99d4cb26-b296-413f-a0f2-d56a0e88cb02","resolution":{"observed_at":"2026-08-07T05:09:34.053645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.626409Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"96340c28-737a-4f19-be8c-171698e30e81","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.125960Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:7205ebaeefdf96e0f20fc34f80e8d919314bf64e2dbc04d0ae19159ab9bf788d","observation_id":"6fde3e4a-7d27-4dd2-8899-cc5c84a54d8f","resolution":{"observed_at":"2026-08-07T05:09:45.658480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.551717Z","title":"Rewarding progress: Scaling automated process verifiers for LLM reasoning","venue":null,"work_id":"ab9163fe-e089-497f-87dd-3bc0434d3259","year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.198454Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:fb402e5034c50c6b96035c89523c1e10db4875d4207af240312424a9fabfc90e","observation_id":"b9fe2fbb-cf39-4bd0-ab3a-daf565f93a65","resolution":{"observed_at":"2026-08-07T05:09:45.586236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.469431Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"34d874f0-25ed-4e5c-9bd9-2160a12b368b","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.320396Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:861f324aea0f1f672d3ee961d586c46c5b8108ec1c6f91765f798248ba6e562f","observation_id":"6661a49b-0f37-47d9-b026-caa023ae1740","resolution":{"observed_at":"2026-08-07T05:09:45.504214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.370551Z","title":"Regularizing hidden states enables learning generalizable reward model for LLM s","venue":null,"work_id":"f08ce31b-5606-4afa-9baa-95da5bb19241","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.412805Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:7366ce01ba9648993575aa6e86e9e1448dfa2908d8632e2e578a3604fa2a66c1","observation_id":"726cb910-5925-4f6c-b4a9-48241819474f","resolution":{"observed_at":"2026-08-07T05:09:45.412624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.247765Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"c6ce8eb7-1b93-416b-806f-2baad2e5266f","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.526511Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:1212b5c54139607f6764b376c31635966db4f331c3f2eb220073c0c9ce9a4c59","observation_id":"53f1914c-cd13-4cac-aaaa-4e94bc21976d","resolution":{"observed_at":"2026-08-07T05:09:45.303562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.119704Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":"782a075c-f066-4bec-9859-5a5e3e82b1a1","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.624566Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:1998580b8d23e8d98400ae0a8a14c54bc11500e61113be54bad971ef25f69a14","observation_id":"edff0ebb-c86c-41a1-a74a-25c15ce9b1c3","resolution":{"observed_at":"2026-08-07T05:09:45.175665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.008640Z","title":"The trickle-down impact of reward inconsistency on RLHF","venue":null,"work_id":"727e3a3b-af9c-4bb8-9369-7bef786afb51","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.718080Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:c42325838ba089117d0b13ae73762d7e26a9899bf5553480dcd267bec1902210","observation_id":"32e99435-33a6-4fd5-a7d6-30f7ff031b90","resolution":{"observed_at":"2026-08-07T05:09:45.062844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.878107Z","title":"Rrm: Robust reward model training mitigates reward hacking","venue":null,"work_id":"04e490f6-48ff-44ce-b4fc-e40a7e0f41fd","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.818224Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:cff8e0ef8c540e0071ebe56ebc01a9cc4acc2e45898386893280d82ed218a2f1","observation_id":"51ecde41-b6f3-43e0-b887-94d27783c4df","resolution":{"observed_at":"2026-08-07T05:09:44.952080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.776168Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"85d15d06-01a0-459f-ae4a-452820847ef9","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:34.911868Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:fe382dc66e9774af7fe80aa82430728f629f74366da9c7e3763de7be9d7f8484","observation_id":"bbc1ae30-c7e8-4a0c-860c-cac1e1c9f90a","resolution":{"observed_at":"2026-08-07T05:09:44.827940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.651242Z","title":"Odin: Disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"c348a950-4236-44f5-8e62-052ba6538b41","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.020744Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:406069d0f3969c66afe9574c6b67a89b1d3013dda5ce3637f81d0aa2a48e5276","observation_id":"2b9af422-9ecf-4211-89ba-30c3ec0a3010","resolution":{"observed_at":"2026-08-07T05:09:44.701760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.526947Z","title":"Improving discriminative capability of reward models in rlhf using contrastive learning","venue":null,"work_id":"20571b58-b987-4c70-9f65-0adec9ce7dc2","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.128852Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:8f7d5ff6eea7c3662cb3a48c5d3df6ba7d7c300c4e9cbcc0c3373ec4082144e5","observation_id":"fdc4bee4-9ae1-446c-aa16-55969f355381","resolution":{"observed_at":"2026-08-07T05:09:44.590224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.414670Z","title":"Rethinking reward modeling in preference-based large language model alignment","venue":null,"work_id":"32daae9f-55e7-4a05-b0eb-470390addcdb","year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.197601Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:dc4d46d2f1a175a96bf4f1cc40fe7c5f7bee7630e6409a01889777ec2d7f4fac","observation_id":"49f91bbc-1be1-4b00-9db4-52a9d972270c","resolution":{"observed_at":"2026-08-07T05:09:44.454000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:35.330672Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.330672Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:45e5d547a66958525a41765672b5ebfe0ef04c34c4a78f2a9e2875cee0d7e7a8","observation_id":"9049e081-f6f4-4c1f-a5fa-e908588fa405","resolution":{"observed_at":"2026-08-07T05:09:35.330672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.277340Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"224f0c9c-66bb-42f3-bd94-a690f77c48b2","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.442708Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:f5d6c2d546f8baabd915353cba1c6aa3e898cab7d77db5321fde79aa6b715274","observation_id":"5e927d83-6394-4273-ac20-844e64b50103","resolution":{"observed_at":"2026-08-07T05:09:44.340960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.136190Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":"5bc17f4c-d632-4c1b-b2c2-dce26ea6e217","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.554133Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:8377f97f7e2ac207cb20b154f6319a737cf29cf2649eea5a1f164e6fb41cbbb1","observation_id":"7a7ca000-670d-417c-8a6a-7a8db72ec35f","resolution":{"observed_at":"2026-08-07T05:09:44.200619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.990376Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":"15661ee9-c059-487f-9e3c-648741273976","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.617671Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:c46aa2d55965351b587d9c6b9ab499a849165affb6cb446ee76130e87c9f8f11","observation_id":"0e4c4813-eb08-4f65-bbb2-cbf80ae1a160","resolution":{"observed_at":"2026-08-07T05:09:44.040192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.885206Z","title":"The llama 3 herd of models","venue":null,"work_id":"8826593b-4e84-4251-aae9-95c23b632f4b","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.758591Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:3bd7aeedcaecf3e41f835edf16a4e39e576820f59a5cb1a70b214030aaad6584","observation_id":"0b1e1919-0da9-432f-98da-33781cc30cd4","resolution":{"observed_at":"2026-08-07T05:09:43.927236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.719354Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":"de206c25-4ed6-44fb-97a5-959fbb6a722d","year":2022},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.867529Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:1150efaf4561615ec881292772fbe730e5b06ece44e60435ca97b03c464f6e83","observation_id":"379d687f-f425-49c7-bf25-29e493da0680","resolution":{"observed_at":"2026-08-07T05:09:43.851006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.424507Z","title":null,"venue":null,"work_id":"da664388-efb0-4faa-a2cc-50a19822d601","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:35.924570Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:5687586e71e7e877b14b82cadcda0413399aa5c503996afc454494ea4147249f","observation_id":"e15458fe-de22-4138-89a3-13ee36986d9f","resolution":{"observed_at":"2026-08-07T05:09:43.590225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.075437Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":"55e34b6d-6994-4eb8-8a38-fb0ee55ac19c","year":2022},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.016024Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:6b9cda9a7447829eb0eadb5a01bd8fad446c50dae3b8de49fbf7765f945dcb8c","observation_id":"2c87082c-53e2-4bcf-8941-90a39fabb102","resolution":{"observed_at":"2026-08-07T05:09:43.247491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.733462Z","title":"Token-level direct preference optimization","venue":null,"work_id":"273a4056-b617-40c3-bb1a-b5cdfc907b35","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.115444Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:238714a4b58e2ac99f7aa194dd8c25d9afc20d5e0c4ff2afe10e2275009fa1e8","observation_id":"b6be155d-90e6-4dfb-8466-2f519790f09e","resolution":{"observed_at":"2026-08-07T05:09:42.898366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.535950Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":"e1196903-f9bf-40b1-9074-abc7449e7c50","year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.195715Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:d85a15a0502d300ce3ceb792359bfeaa6d9bbdb28b32f2990cae2c853ff4912b","observation_id":"835f56c4-ee2f-4d5e-b96b-004c8aae0fb5","resolution":{"observed_at":"2026-08-07T05:09:42.614422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.430537Z","title":"Gen ARM : Reward guided generation with autoregressive reward model for test-time alignment","venue":null,"work_id":"3286e33c-d336-465d-9558-2611b8069cf0","year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.318045Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:25d20b85a028774d7dd3251322072875797cefa17c160b02df46ad4546c7b60b","observation_id":"521f59ea-afed-41d1-be65-117b7ccc2e9c","resolution":{"observed_at":"2026-08-07T05:09:42.503125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.316491Z","title":"Fine-grained human feedback gives better rewards for language model training","venue":null,"work_id":"71f71ac2-8319-4dff-ad05-de5e2f25fa5c","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.407602Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:e6bded730c3a3afe183c86175b56420796c7dbcd383cc256afc24610608653d9","observation_id":"1be149c5-8847-42b9-a1aa-f1115b8585de","resolution":{"observed_at":"2026-08-07T05:09:42.368824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:36.488861Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.488861Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:0c6b9ede347ab0fe93d50d8b5028cf3a1931a67467c422bd84e0c37079364cf5","observation_id":"196c5c63-3519-4ae4-95de-a01b34f6c74a","resolution":{"observed_at":"2026-08-07T05:09:36.488861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.183959Z","title":"Process reward model with q-value rankings","venue":null,"work_id":"2c3dee64-88ec-4948-a764-4beef3c1d623","year":2025},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.596630Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:24f6fc892ce3e7548e98844c8b730badb242de5cdb712839042c1d16f7e90cdf","observation_id":"6237dda3-1d2e-4d98-b747-9e20ee8a911f","resolution":{"observed_at":"2026-08-07T05:09:42.234540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:42.046377Z","title":"Coda: Contrast-enhanced and diversity-promoting data augmentation for natural language understanding","venue":null,"work_id":"b414abea-bb96-4a68-ac59-c37aa594b356","year":2021},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.685789Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:f67ff907f8eb126169b68a9154b5157a3fceeb80a27f54d765362560629e209b","observation_id":"ce204ed8-5904-45fb-9405-ced160567cf9","resolution":{"observed_at":"2026-08-07T05:09:42.119546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.915190Z","title":"A survey on data augmentation for text classification","venue":null,"work_id":"d76b4b27-2176-4439-a9f8-3e04edab4516","year":2022},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.777800Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:1c63a38c5ba52b69530e80c5de3ffa4c7fd4a7ac18a5b2d340450dc878907d7d","observation_id":"98bdd41b-ec82-485a-943d-8e407496663e","resolution":{"observed_at":"2026-08-07T05:09:41.971159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.790715Z","title":"Cubuk, Alex Kurakin, Han Zhang, and Colin Raffel","venue":null,"work_id":"dbd5c220-d787-4fd7-9e90-3e24a4a723f4","year":2020},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.873930Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:d7f3d88cb8cf8ce1484d2ac5055f87d476aace47f4a4535abb03227587b67e74","observation_id":"44606918-c76c-4a6c-bd26-703a45d2b9f7","resolution":{"observed_at":"2026-08-07T05:09:41.850902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.680965Z","title":"Flexmatch: Boosting semi-supervised learning with curriculum pseudo labeling","venue":null,"work_id":"d051e6a5-9ffb-4927-9d0b-297120e9c24d","year":2021},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:36.958032Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:2d0c3076a5000c32f2e1e3386db02672718a7f33aa071e6e5e5cedce9183dcde","observation_id":"8e096c90-a31e-446b-8466-1a2f3dbd2c6d","resolution":{"observed_at":"2026-08-07T05:09:41.732648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.563315Z","title":"Qwen2 technical report","venue":null,"work_id":"46dd01d5-3a84-4009-a26d-2f0bd00153a8","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.074903Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:3008e583b714b7355deeeaf23337df6267377c6d710a0b42124bd159dc99eea8","observation_id":"62cc8540-6c22-42c8-bf54-bd30eaa62a12","resolution":{"observed_at":"2026-08-07T05:09:41.612274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.449878Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"62faa74c-3b3a-4ac9-b6f4-5534c81b8013","year":2021},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.183892Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:a1b881fc3e7248031b3e6e2170e7fa9ed8e46fbb414d13438d33aba879589417","observation_id":"5b5989df-c9f7-487c-abac-0ae2dad00254","resolution":{"observed_at":"2026-08-07T05:09:41.503487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.339181Z","title":"Free process rewards without process labels","venue":null,"work_id":"fdd592e9-08ba-4c5d-8a21-8504b1e27c96","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.281339Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:67615905abc2a2fbfe6687f2392510044534514f07d519baecbac2d7b6d42ce3","observation_id":"73391db7-3f72-47da-8f0c-1a3638a177ca","resolution":{"observed_at":"2026-08-07T05:09:41.385834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:09:37.400183Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.400183Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:6b81e28e29cf77cfc487c6669b76df3171f8e56fd56984bf08d355aeffce5266","observation_id":"3bc09aff-6ed7-4505-8345-735472625b6b","resolution":{"observed_at":"2026-08-07T05:09:37.400183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.207217Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"1c8e64aa-5bd1-4c22-b746-96eb557a994e","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.508705Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:566d347316f3560189768060642d37fc84f8b11e0bf3ab96ce2a96caf0137c3c","observation_id":"f2697b11-fb0a-4340-8c89-b747571cf43d","resolution":{"observed_at":"2026-08-07T05:09:41.255820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:41.053183Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":"776434f9-7794-4eb7-94a7-7f560a887592","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.639203Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:aeb7429ade77cd858bb5ef582f62eb2abc4b03f8ca6277fd801768f55133a1b2","observation_id":"10235350-5bec-4bbc-a2e7-56b114fc2575","resolution":{"observed_at":"2026-08-07T05:09:41.128081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:40.896274Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":"661b22fc-ad9c-47a8-9f6c-de6db4043697","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.747142Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:1426c72fc8fd1733c84a8f79acdcc034b954a9f79d746f1b9025d65ed5a9ed0d","observation_id":"6e5a6512-f8d7-4337-b74d-7e6e175ebe34","resolution":{"observed_at":"2026-08-07T05:09:40.978309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:40.688611Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"eed09b42-eaac-4ce8-b56b-fd67ea8777bb","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:37.856360Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:fdb02a113839ff958730658dafa9d54f19280c88eaae0847d17b7cc2e240648b","observation_id":"e05e6164-2d74-45cd-a9a0-df3fa4aefba7","resolution":{"observed_at":"2026-08-07T05:09:40.799148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:40.514013Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":"a20fda97-4d97-49b5-86da-f55d3e4bde8d","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.001579Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:2d25f2eb562ca35076d5c258379c54b437fdc97964277a22f5fa2b27b2384d1d","observation_id":"43d67609-7c95-4db5-b8a2-0c528715a0b9","resolution":{"observed_at":"2026-08-07T05:09:40.614967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:40.359197Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"c818a958-3a9d-4746-873f-5a3b0a11dbef","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.111936Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:37d26b28f9d23b376f39faeccb04b166b8ba4bb6dd4f16d139390cc71f644711","observation_id":"f81486a0-a0ec-4cec-83a8-fc12d2ec4624","resolution":{"observed_at":"2026-08-07T05:09:40.426846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:40.187137Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback","venue":null,"work_id":"69fd468d-0b4e-446b-97f9-7a36c52354aa","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.239973Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:a2716489c84fda56bc0dd33daf98f8d9cc55a2e8b9bbb9ded4e8c9e8adfd0af6","observation_id":"3c2aebab-b8cb-4e42-b102-a5ccbcf6015e","resolution":{"observed_at":"2026-08-07T05:09:40.259515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.986231Z","title":"Loose lips sink ships: Mitigating length bias in reinforcement learning from human feedback","venue":null,"work_id":"1f251c3f-6282-42f0-9165-403694209918","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.357506Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:3ec42244166118a16c6798fa65fceb370791df80eb5b1c3821aa844ed64047a8","observation_id":"30b3becf-60e8-4b2f-b91a-08d6e6de7e84","resolution":{"observed_at":"2026-08-07T05:09:40.082421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.822732Z","title":"Pfohl, Deepak Ramachandran, Peter Shaw, and Jonathan Berant","venue":null,"work_id":"0a566e24-e6b6-4a18-9472-82be94c501be","year":2023},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.466365Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:099325ac5129ebc8bd06dd53d4b152de92f58a24ae92ec542fa7f33c6178d3d9","observation_id":"d8e979ef-ed7f-4cfb-ac10-6836fa9f4ea1","resolution":{"observed_at":"2026-08-07T05:09:39.901062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.689407Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"7ebe4412-d68f-42cd-b027-ea7fede4ff78","year":2017},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.545848Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:7771d07f35d9154b03aa47f7743be39e14a0d5b236631aa02ee9040515c69eb9","observation_id":"7d9606f7-8284-4b33-8833-7550696c0906","resolution":{"observed_at":"2026-08-07T05:09:39.751532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.470587Z","title":"Understanding the learning dynamics of alignment with human feedback","venue":null,"work_id":"93ca9797-7046-42c1-945d-e7a43bd4147b","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.671903Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:b641fa2ebd1165bff49b6429dd7998a48c346058ff14c7360b2166c4cfb2f71b","observation_id":"49fbd15f-3dca-4368-b712-494501cc534c","resolution":{"observed_at":"2026-08-07T05:09:39.555383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.300993Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":"4d4d8a6b-6949-49f1-a025-6e9ba98dd3ec","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.760953Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:7faa3584e4b8cca749372475a1668af53b9e0972a3dfd47d832ef2522813e5f2","observation_id":"f245d885-99b7-4bee-be2f-03ae603fcd91","resolution":{"observed_at":"2026-08-07T05:09:39.388219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:39.128214Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":"c84bb679-9104-4898-a582-429ec9ae42b8","year":2024},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.854123Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:cdb4e399ee5ca89af1cced4db9ca6ac464cd108084386813a92e90c86d01d4a3","observation_id":"dab70296-bd7d-493d-b28f-2bcddad4ce2f","resolution":{"observed_at":"2026-08-07T05:09:39.187419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:38.960214Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:38.960214Z"},"links":{"citing_paper":"/paper/2506.09096"},"observation_digest":"sha256:6247b9c68573ba0545acad559a88a7d78f6d7fed2bd098fb8bd45e0b183ca8d0","observation_id":"1327d8a5-e129-4bc2-a7e8-75d29996d2b4","resolution":{"observed_at":"2026-08-07T05:09:38.960214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09096","last_updated":"2025-06-16T04:03:11Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:00:14.370421Z","submitted_at":"2025-06-10T12:59:14Z","title":"Intra-Trajectory Consistency for Reward Modeling"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.09096."}