{"as_of":"2026-08-14T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3246de47326b62d363f145bb7c66f8517de5dddb639076c85d95acee61ac9c7e","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:40:11.975172Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08491/citation-record","integrity":"/paper/2608.08491/integrity","json":"/paper/2608.08491/citation-record.json","paper":"/paper/2608.08491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.583426Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":"22ee6e5d-92eb-4b4f-8df8-a6746bc3ea14","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.779147Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a53f10964b0b0fcfe9359cc7afe480f132ce32caa010d377be0e4719b97a8c56","observation_id":"e0d22af6-881a-40a9-ad56-cfcaa581314c","resolution":{"observed_at":"2026-08-14T04:40:12.587619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.784324Z","title":"Serl: A software suite for sample- efficient robotic reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.784324Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:bea33957d1a7b838e5942df1106a80910157818b81c5db01abcf55e64b58f2f2","observation_id":"e5ab305d-2dae-49b4-8184-b6bda825693b","resolution":{"observed_at":"2026-08-14T04:40:11.784324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.788149Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.788149Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:916a04b93a6283ede6c82d94d9909ce83b01283f934cf72b76b4aa033bb1ab13","observation_id":"62a73c9e-3392-40cf-a88e-febe6f022191","resolution":{"observed_at":"2026-08-14T04:40:11.788149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.792711Z","title":"Improving vision-language-action model with online reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.792711Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:0118bdcef4bbc55844f298c9c2d4ca53c81a0619c06a74b1ccc1bf2dadd42f17","observation_id":"2e38b2f5-f651-47ad-923c-a4f7d76c52ea","resolution":{"observed_at":"2026-08-14T04:40:11.792711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.549594Z","title":"Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics","venue":null,"work_id":"d8d70c73-b10b-49e5-b3a7-d96302fef772","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.796781Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3c5546e2540d5c7082b4a7a6479f3c06d8fca5e4adb3a2db212c92ac66e8690a","observation_id":"769055bf-55da-4452-90ad-e1cce2da1523","resolution":{"observed_at":"2026-08-14T04:40:12.554576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.537607Z","title":"Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own","venue":null,"work_id":"89a167b9-8372-4f49-8980-9bb9de18a0f3","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.800620Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c257fe9c4532efa5b4b01907731274c90f2015ca0139d284d66c5aeb850aaf7e","observation_id":"9ca47e5f-3f36-4b14-8605-de65615983c1","resolution":{"observed_at":"2026-08-14T04:40:12.541917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.525702Z","title":"Self-improving embodied foundation models","venue":null,"work_id":"b1e0a8c5-02e5-4f80-af6e-94c1359e69a9","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.804984Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:25889f8dc51ca14194f59d7d776c92ad7e5a9071f7721152f4ef76c29a390a48","observation_id":"30d88430-1e91-41cd-822f-e86ab0170b9f","resolution":{"observed_at":"2026-08-14T04:40:12.529740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.809335Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.809335Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:dc4d30a1a59a4d5f5a8c543a996734a99d67418b434c9736dae7b6d7405ce01f","observation_id":"d9f4bd21-72a3-4fa7-9909-efd9b3646c86","resolution":{"observed_at":"2026-08-14T04:40:11.809335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.504992Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":"a7628821-a221-4afb-b0e5-061da15c5270","year":2022},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.813385Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:38e81d7da209d1b4058df3fb3c30e6dd57914c7f56c818418b87747fa37222c6","observation_id":"ee2fe596-3c97-4093-a37c-1e5df48ade05","resolution":{"observed_at":"2026-08-14T04:40:12.510106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.817154Z","title":"Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.817154Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:fc05bfcff3da1ad42673b7d1f64594e17433a10421262523c2de01b2086b9039","observation_id":"6d2e1e5f-42ba-49b0-9dfc-961bd938fc13","resolution":{"observed_at":"2026-08-14T04:40:11.817154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T04:40:11.820969Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.820969Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e85bdc5cdf76aa4d6b4a5623d850924872fc877b23150214d9312fd424001ff9","observation_id":"c6ced9ac-b537-47b1-b6e7-e1ea237941f2","resolution":{"observed_at":"2026-08-14T04:40:11.820969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.493264Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025","venue":null,"work_id":"0ce51d14-edce-4e3a-83cf-d646bdfa1d7b","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.824989Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:302c7fa813deb9a1b04b7104abed87766a54ed9af0ac4889a6695db9068116c9","observation_id":"5e30c658-ab9d-462b-9014-8f3557ebefcc","resolution":{"observed_at":"2026-08-14T04:40:12.497747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.481632Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking","venue":null,"work_id":"b7268dc8-f5f5-4774-a425-9bd47311ffed","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.828550Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e43fb178de086738826ac5ec3c6208f8eaac35fd918cbe51d5688f9b76dd9480","observation_id":"c4470bf2-8fcc-4120-8bdb-1f8db33533c1","resolution":{"observed_at":"2026-08-14T04:40:12.485788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.469513Z","title":"Training software engineering agents and verifiers with swe-gym","venue":null,"work_id":"13398cff-0c0c-4d98-97c8-eb77190d40b5","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.832736Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a3a572b38a5a5328f1e35c31ea24a439f9d243715756f1ab78bada7c3f960c16","observation_id":"1cddd270-4b8e-4d7d-9528-9d61ca4b08e2","resolution":{"observed_at":"2026-08-14T04:40:12.474431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.836535Z","title":"Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.836535Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:efa039b3c74e04a82292f0c24f97c3d8afee4fb7124cd8a9a2a4f8d40178e3bd","observation_id":"8a491032-55db-4aa9-8f3f-b0b755e49a0d","resolution":{"observed_at":"2026-08-14T04:40:11.836535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.840164Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.840164Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:916f5a4a3e88272b872bb7f705c77217256765bfacd56a6627f7d3897a23b3c2","observation_id":"aab7bcd4-4428-4309-883a-25b4b258a4de","resolution":{"observed_at":"2026-08-14T04:40:11.840164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-14T17:59:52.524740Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-14T04:40:11.844460Z","title":"Openhands: An open platform for ai software developers as generalist agents.arXiv preprint arXiv:2407.16741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.844460Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e9747844439cf7345b976b370e73fd4967ab59494a21509c2f51f50ce92f4447","observation_id":"0f46069f-7c1b-4654-84df-8d5951222a0d","resolution":{"observed_at":"2026-08-14T04:40:11.844460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-14T04:40:11.849338Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.849338Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:6ea4d8148abed7accd27da5c2d95d32408ed89fd0d8421309df980ebe52212fc","observation_id":"cd4ec506-4b13-428a-944a-5586424a8fdd","resolution":{"observed_at":"2026-08-14T04:40:11.849338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.853614Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.853614Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:4ccaf8b55c36c030f6f9aff5cbc224914bedaa02744d838f957bc05d44694e63","observation_id":"0244c97d-84c3-426d-b3c0-5cac0892ee80","resolution":{"observed_at":"2026-08-14T04:40:11.853614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-14T04:40:11.857250Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.857250Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:eaf18fc251371d4718da8d12537aa05ffcf63d0b42ad065b026c18f5cc2be336","observation_id":"cbd3c701-2e96-4d91-a28f-00fa08833227","resolution":{"observed_at":"2026-08-14T04:40:11.857250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.860774Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.860774Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:82ec4dc01d75591bdf0710c09ce7da04b67d02bc45b23f8495af06380a860cbf","observation_id":"49f5f19b-2114-465f-b9f8-0c06d8428758","resolution":{"observed_at":"2026-08-14T04:40:11.860774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.864231Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.864231Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:68af0628d14604be8b078960be30b13efeb4ea3c43735ece9c2071197077d222","observation_id":"b0ec75f3-7a02-4059-91b8-766d49da58c8","resolution":{"observed_at":"2026-08-14T04:40:11.864231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-14T19:30:52.458536Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-14T04:40:11.868376Z","title":"RLAIF vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.868376Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:fb1f4666cde5a62b7bb3f012d78ab6532881d6c462ed9a69ab03604330242259","observation_id":"9bae433f-b067-4f58-be23-2d5f145d7305","resolution":{"observed_at":"2026-08-14T04:40:11.868376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.872649Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.872649Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:fe293070b27259363a20afb48cc806f8ed90f55e26ac63ba78b70db3a591d446","observation_id":"24d777e0-76c9-4ab5-85bd-eae9eff9b2a4","resolution":{"observed_at":"2026-08-14T04:40:11.872649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-14T04:40:11.876058Z","title":"Chatbot arena: An open platform for evaluating llms by human preference.arXiv preprint arXiv:2403.04132, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.876058Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3d632e2fb9fae039f7f6e3a072985ac795190ef81bbd7016f24856dff85b3dde","observation_id":"6fb073d5-c527-4045-a412-cf0a26b973ef","resolution":{"observed_at":"2026-08-14T04:40:11.876058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.408972Z","title":"Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them","venue":null,"work_id":"b69b831a-7972-42c9-8c7c-bb350fb0c64b","year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.879873Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:6de3133becc5d48bb56d0f00732d4d2742c2396271da72c7e67cb7469232c553","observation_id":"2c9bbe76-1df1-4aef-ae18-83594b368b6d","resolution":{"observed_at":"2026-08-14T04:40:12.413092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-14T04:40:11.883152Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.883152Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:79cca1f6a64e81ac03a7baf1ad326bae345500d3e12d2a3171fd6b01ff02f5b2","observation_id":"95d835a8-80d7-4953-a92f-9aba5429a9ae","resolution":{"observed_at":"2026-08-14T04:40:11.883152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.886678Z","title":"Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.886678Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:631a0177d427b11f60cdb1e735b32be5ea7c5a9068d692c87df726ca88190109","observation_id":"3d3d6085-8313-4b13-a5d8-55ee0111d7e2","resolution":{"observed_at":"2026-08-14T04:40:11.886678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.396072Z","title":"Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research","venue":null,"work_id":"17b77895-f94f-4515-ab24-ca5288642ed6","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.890054Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:de9ab0b31ac656ee775004969fcf6b52740f1e5e2f21348235fbd60c755a1742","observation_id":"567042e8-a546-4d6a-9c96-f9deddd1aa5c","resolution":{"observed_at":"2026-08-14T04:40:12.400689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.893585Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.893585Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:314343fee6242ca1f57255ab412330e3164c66b4040d88f27c11253104253870","observation_id":"aa3b390b-492d-4fd5-967a-aeddbd515426","resolution":{"observed_at":"2026-08-14T04:40:11.893585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.896957Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.896957Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:442d1d87e43c44681586c659032b4fabddf0ede329bb12b569f18148a62fd17c","observation_id":"1a132033-3cb5-484d-8f74-39ce15a92cb4","resolution":{"observed_at":"2026-08-14T04:40:11.896957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.369690Z","title":"MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark","venue":null,"work_id":"f08fdce4-bd2b-4d12-85b3-e84987de3b52","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.900443Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c69830f4acfa82bcc4dffb615c2fb56bfb467f47e63aceb1f532aa883701207c","observation_id":"0358f445-0b76-4706-ad16-d7655157e7d1","resolution":{"observed_at":"2026-08-14T04:40:12.373460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.903918Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.903918Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a685ccfaa5afc8c559419bc8fcb327a57a321822796de9c0bdcc8b80f7d2d15c","observation_id":"2c624792-f540-4523-b288-24a52e8861ae","resolution":{"observed_at":"2026-08-14T04:40:11.903918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-12T22:32:17.121578Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-14T04:40:11.908413Z","title":"Generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.908413Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c5432590543fb890e7d9b71b85f7a319898896a39418cd2ab363c1f291dc6a57","observation_id":"e25d5e47-2cdd-4167-bc22-087b125ba711","resolution":{"observed_at":"2026-08-14T04:40:11.908413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-08-12T22:18:17.243820Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-14T04:40:11.912277Z","title":"CompassJudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.912277Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:6478b7da050de8c6a72514c04367b8b432e91be23760d4295338218d606af2da","observation_id":"be7c3ea8-06e3-45d4-a8a0-e9b0d15f2db7","resolution":{"observed_at":"2026-08-14T04:40:11.912277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.351531Z","title":"Vision- language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":"a830c4a4-5860-44c4-b6f0-de7d0dd91981","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.916450Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:02f2bef2d9a05db107abacdfd37c891f3d9f1b744c6cd817e373e45bf9a4d407","observation_id":"82c510b3-bbc4-4023-8563-b5d3aeec15a6","resolution":{"observed_at":"2026-08-14T04:40:12.355874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.338155Z","title":"Rl-vlm-f: reinforcement learning from vision language foundation model feedback","venue":null,"work_id":"5244d76e-4f39-4a1b-bba5-6fc73cec2f20","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.920048Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:522b0189d583c1721e848a8f8f64a26fcad2292124dd46066a6d338c7a4489e5","observation_id":"d15df90e-4803-44d6-92a7-80e66e763c95","resolution":{"observed_at":"2026-08-14T04:40:12.342809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09187","last_updated":"2024-07-12T21:14:32Z","snapshot_observed_at":"2026-08-13T14:21:04.495579Z","submitted_at":"2023-12-14T18:06:17Z","title":"Vision-Language Models as a Source of Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09187","snapshot_observed_at":"2026-08-14T04:40:11.923452Z","title":"Vision- language models as a source of rewards.arXiv preprint arXiv:2312.09187, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.923452Z"},"links":{"cited_paper":"/paper/2312.09187","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c0d414a035c99dd500764e49aac6c2443b3e0b60291b8d03e191cc56b7077895","observation_id":"0884635c-e168-4f7e-8c97-f4efbcac098c","resolution":{"observed_at":"2026-08-14T04:40:11.923452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.323654Z","title":"VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":"10f93633-8f84-4ba3-94cf-68db829113cb","year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.927270Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:67678d6b560fdff3508d2890a9f6a2effd4d04e1801089e8be676fd1e9821f0e","observation_id":"e6b023bb-0e25-414a-9ac6-145d4b8800f1","resolution":{"observed_at":"2026-08-14T04:40:12.329036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.310883Z","title":"Improving video generation with human feedback","venue":null,"work_id":"978ae855-1237-4ecc-b7ab-4d1ddfee97f8","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.930706Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:32b9007a83251da0183c3c138f7ac335fed95f3d9bff41fc22da6fa97be54939","observation_id":"2ed783aa-f9e8-42c0-9c80-2013255c69df","resolution":{"observed_at":"2026-08-14T04:40:12.315099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-14T04:40:11.934216Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.934216Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:1b77890a90256c1c59b8bc3e7b321056fa765ee8e56051aef9b56388eb641e6f","observation_id":"aa38349e-b5d5-4685-97c6-03eaab10ba6b","resolution":{"observed_at":"2026-08-14T04:40:11.934216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-14T04:40:11.938227Z","title":"Multimodal reward- bench: Holistic evaluation of reward models for vision language models.arXiv preprint arXiv:2502.14191, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.938227Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:803f4cd9a5fdfe6d7037a9958e38942bcd0dcee3f0d5f7f518e274b43324c182","observation_id":"9be46e54-4553-46b7-9318-4825b8aaabbb","resolution":{"observed_at":"2026-08-14T04:40:11.938227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.941977Z","title":"Vl-rewardbench: a challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.941977Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:711f144b13cd645c5bf72d6afc937f57332db218a0dcdcc3d3beaa4671841a09","observation_id":"04a0d552-7e46-4fe0-8ec3-db08307b25d3","resolution":{"observed_at":"2026-08-14T04:40:11.941977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.945910Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.945910Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:61f51cfd73ea6b95fd0655326da4d90f0e52b899942bca13a30ffb4715c446ef","observation_id":"e0a2c348-bf0c-4fa1-a269-d6549e76e10b","resolution":{"observed_at":"2026-08-14T04:40:11.945910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.285318Z","title":"Aligning with human judgement: The role of pairwise preference in large language model evaluators","venue":null,"work_id":"13cc9d03-910c-4610-8761-154b771eeda8","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.949377Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:244ea3ace28c878f51c4ef01e2119caf6800ceeb091d063decaba6fe06f3484a","observation_id":"33621821-7d61-40bb-ab70-e5d5e7c53fb5","resolution":{"observed_at":"2026-08-14T04:40:12.289737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-14T04:40:11.953577Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.953577Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c6b9f32904ef3193c05250b35f7b3aca6aa72dae0b309b9c9f319ec23138fb81","observation_id":"85df1f86-a21a-437e-95d8-6f8232afdfb2","resolution":{"observed_at":"2026-08-14T04:40:11.953577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.957080Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.957080Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:40a4a26b6784f45c00b226d2291f5ac066b2fb7fe97fea5cf0965593bb082ae2","observation_id":"1d27a4f9-312c-4712-b3c9-eb31e566a8ad","resolution":{"observed_at":"2026-08-14T04:40:11.957080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.266043Z","title":"An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955","venue":null,"work_id":"e7611777-3ea8-4fc4-a423-421a5965cf58","year":1955},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.960523Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:0ec59c30e692815ca0f4400449da93849ef8e9485383c3580c5f3051084e1bbd","observation_id":"1f9e4c15-1c26-4f84-8480-61c12bb86da4","resolution":{"observed_at":"2026-08-14T04:40:12.271486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.964323Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.964323Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:174a02779da19403796643ffecc5b23b3260a3b8ccd5fe94101484c8ba3924ce","observation_id":"6daa94cf-372b-4674-9224-44b2b1c4959a","resolution":{"observed_at":"2026-08-14T04:40:11.964323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.968028Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.968028Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a03cdce67ccc0053bd3c7551031b5d1ece83c6c4f3b1c1e2882e051020bf79e5","observation_id":"5c570ab1-c0c9-4ba6-85ed-58cc0c1e2242","resolution":{"observed_at":"2026-08-14T04:40:11.968028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.971503Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.971503Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c6faa62b7c4c981a918141e4424122a579000030045bb6e830e92d2349c9ae82","observation_id":"49b5de5b-6a5f-423a-bddb-39e2d77891dc","resolution":{"observed_at":"2026-08-14T04:40:11.971503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-14T04:40:11.975172Z","title":"Pick up the yellow cup","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.975172Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e6b4dfecbf290b53bd5c09ceb2ba8f05e99a817df24932e79e7159fd53c41e31","observation_id":"5231abc1-8303-491c-bc12-84ef2fe769e3","resolution":{"observed_at":"2026-08-14T04:40:11.975172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T04:31:34.121482Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.08491."}