{"as_of":"2026-08-08T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9386532c3a63ba4137e6da0114ffd2586cb512f4def46542f3ebb6337f77192","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:48:23.200455Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09055/citation-record","integrity":"/paper/2509.09055/integrity","json":"/paper/2509.09055/citation-record.json","paper":"/paper/2509.09055"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T19:48:22.384196Z","title":"D., Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.384196Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:cca7af8bfbd6d2b1f13bfd9fc8d9504a08699c2bb0869f8f62515a87d785d1e5","observation_id":"e05c4997-8370-41ed-bce8-eefa7f93d9e5","resolution":{"observed_at":"2026-08-04T19:48:22.384196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-04T19:48:22.457324Z","title":"V., Mihaylov, T., Ott, M., Shleifer, S., Shuster, K., Simig, D., Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.457324Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:04fb45895ceebad6a95580de9b84e8ae4f4595d56d4b4531df5d1988a82dc5de","observation_id":"713eddfd-fe4b-429b-a5e1-ddcdc75da528","resolution":{"observed_at":"2026-08-04T19:48:22.457324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T19:48:22.569427Z","title":"R., Christiano, P., Knight, M., Kaplan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.569427Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:7d6736342b509e76ad91f63b253b1edbf919c012619bbccd7d37f4ae3436af94","observation_id":"b1d66f49-ccf2-4d08-be9e-eaccbf368904","resolution":{"observed_at":"2026-08-04T19:48:22.569427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04751","last_updated":"2023-10-30T20:36:20Z","snapshot_observed_at":"2026-08-04T08:05:09.732049Z","submitted_at":"2023-06-07T19:59:23Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04751","snapshot_observed_at":"2026-08-04T19:48:22.658957Z","title":"A., Khashabi, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.658957Z"},"links":{"cited_paper":"/paper/2306.04751","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:cd92724e85a44c5275ea86bf2a3557cdf76656dbfec2b8cabbe64a19b345566d","observation_id":"2a73cc95-c9ce-4d0c-a535-f8894b8213b0","resolution":{"observed_at":"2026-08-04T19:48:22.658957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10659","last_updated":"2024-05-20T14:27:37Z","snapshot_observed_at":"2026-07-06T18:15:42.050651Z","submitted_at":"2024-05-17T09:42:59Z","title":"Realistic Evaluation of Toxicity in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10659","snapshot_observed_at":"2026-08-04T19:48:22.761053Z","title":"S., Le, T.-T., Ngo Van, L., Nguyen, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.761053Z"},"links":{"cited_paper":"/paper/2405.10659","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:1198bad000e2c328e32478f451ec508723465aa20639f1b0ade27d2825ad767d","observation_id":"7740676d-a93a-4607-ba59-16987e2cb33d","resolution":{"observed_at":"2026-08-04T19:48:22.761053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01805","last_updated":"2024-05-03T01:28:21Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-03T01:28:21Z","title":"Crafting Tomorrow's Evaluations: Assessment Design Strategies in the Era of Generative AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01805","snapshot_observed_at":"2026-08-04T19:48:22.847237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.847237Z"},"links":{"cited_paper":"/paper/2405.01805","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:6d87d18da220ed650918419936e32e804856c0947d628d7cccc417c239d1663b","observation_id":"40651299-5700-4120-a563-dfeaa452eef7","resolution":{"observed_at":"2026-08-04T19:48:22.847237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14337","last_updated":"2021-04-07T17:49:17Z","snapshot_observed_at":"2026-08-03T23:24:34.241550Z","submitted_at":"2021-04-07T17:49:17Z","title":"Dynabench: Rethinking Benchmarking in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14337","snapshot_observed_at":"2026-08-04T19:48:22.922729Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:22.922729Z"},"links":{"cited_paper":"/paper/2104.14337","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:10427547e92f2cd630f6665a9920f80e3f7d23881d84d6cdd97401f688dfb276","observation_id":"91451675-098c-4626-8d54-ab661566828f","resolution":{"observed_at":"2026-08-04T19:48:22.922729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-04T19:48:23.005157Z","title":"M., Stiennon, N., Wu, J., Brown, T., Radford, A., Amodei, D., Christiano, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:23.005157Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:7546265e535f06c7ce08064eede8ec5b4c65043332dc4151ae31eddaad2ca686","observation_id":"ced9a9ae-fd1e-4e8f-b6bd-6c8b837f7175","resolution":{"observed_at":"2026-08-04T19:48:23.005157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-04T19:48:23.101317Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:23.101317Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:6ab59344ebac16e01c61855b2189874fc03a5cb6a41c22cc1e1941480b0d3616","observation_id":"4adc5a6b-4463-4caf-831a-8f4ac4bf5faa","resolution":{"observed_at":"2026-08-04T19:48:23.101317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14723","last_updated":"2025-02-08T16:29:14Z","snapshot_observed_at":"2026-07-06T18:04:08.777507Z","submitted_at":"2024-04-23T03:55:01Z","title":"Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14723","snapshot_observed_at":"2026-08-04T19:48:23.200455Z","title":"N., Baral, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:48:23.200455Z"},"links":{"cited_paper":"/paper/2404.14723","citing_paper":"/paper/2509.09055"},"observation_digest":"sha256:855aad13d92b49f9876530b6baeac9205a9a601bf562c914f19ce89dbcd4c1c0","observation_id":"98b8aa4c-6825-4719-a95a-f90b96b1c0e0","resolution":{"observed_at":"2026-08-04T19:48:23.200455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09055","last_updated":"2025-09-10T23:22:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:43:24.072429Z","submitted_at":"2025-09-10T23:22:59Z","title":"Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2509.09055."}