{"as_of":"2026-08-13T06:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:297ac9cc1f0a0295b135a8a6640e9510af954be3fb3ca4ebe9eca09cff6b3240","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:51:53.299361Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09341/citation-record","integrity":"/paper/2411.09341/integrity","json":"/paper/2411.09341/citation-record.json","paper":"/paper/2411.09341"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.140481Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.140481Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:717e3d18593a46e7cfed6aa1c3ab448a8bceab5369fddc5d089e8f729cec4704","observation_id":"f6544a8d-a5d6-45ec-9049-433565394c03","resolution":{"observed_at":"2026-08-12T20:51:53.140481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.146561Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.146561Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:879d4350268d186ef8de59d53d219a41e5873f84d47813f6457940ce088ead7b","observation_id":"ec330355-af13-4987-84ff-9aec71cb526b","resolution":{"observed_at":"2026-08-12T20:51:53.146561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T20:51:53.152257Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.152257Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:f9c5378a6b7e5d58ce204b530e032cde3d0a343c6db265f6baeecb64fb1cdf8f","observation_id":"0e711594-8e85-4c93-9b0d-0a169ca5e309","resolution":{"observed_at":"2026-08-12T20:51:53.152257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T20:51:53.158078Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.158078Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:f17eaa518fa0ab958e8d8d5228943c113aefd76509afdf7f6f4332baad06e045","observation_id":"07a35865-d9b9-46b2-a8eb-14a626b7c5be","resolution":{"observed_at":"2026-08-12T20:51:53.158078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.163436Z","title":"A.; and Terry, M","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.163436Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:17383cbee518cfa0a2d370c1e8396844285711fa5039b595d1dfdb480d383fa5","observation_id":"af6357ba-414a-47e1-b329-5a5bf6b44c93","resolution":{"observed_at":"2026-08-12T20:51:53.163436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.827050Z","title":"J.; and van der Schaar, M","venue":null,"work_id":"5c38d93c-7b90-449a-a6bf-a71189243428","year":2021},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.168178Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:b3e6661465195d984db44908da09a245be7d83a57882d80c18fb9bea97fa7173","observation_id":"913daf76-fb90-4b3e-b938-856f51740ebc","resolution":{"observed_at":"2026-08-12T20:51:53.832025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-13T05:57:41.785838Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-12T20:51:53.172925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.172925Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:77324e79d62d84899126e79d4ae6febb13aad5e9bbfff355dbb79bbaab55d080","observation_id":"79fa944b-b6a5-4a26-a5ec-b35439a72899","resolution":{"observed_at":"2026-08-12T20:51:53.172925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.177784Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.177784Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:f995a32e4b5f9e4ce38638cf6a33e4c2c1a76934b030d1b78dcda3034258d2ba","observation_id":"e0a04680-6b45-42a7-9a5b-3c3d099f4132","resolution":{"observed_at":"2026-08-12T20:51:53.177784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-11T02:56:19.720511Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-12T20:51:53.182857Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.182857Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:5930dc04183759fc4d4ec6a9a7cc76098e4f8f3f3a052421ee1555e4d77e64d8","observation_id":"3dd6691b-88d4-4ef4-a09f-c38caea325b8","resolution":{"observed_at":"2026-08-12T20:51:53.182857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.803667Z","title":null,"venue":null,"work_id":"69c8a3d6-ad3a-449c-93a8-4dc939dc051b","year":2024},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.187657Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:080b6f24f22f17d8793899fee0eb0a87bf61216427e78b997053c70b75301e68","observation_id":"180e9686-c04d-49b6-9e74-8d0dc51b390b","resolution":{"observed_at":"2026-08-12T20:51:53.808270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-12T20:51:53.191887Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.191887Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:fb76ce0d46fdd5e24e200911e9bf8917488d0d6ff2a54c7b783ddb6004abe810","observation_id":"6a1a0f39-1a00-4596-90d0-c3ecab994e9b","resolution":{"observed_at":"2026-08-12T20:51:53.191887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00957","last_updated":"2023-03-02T04:24:29Z","snapshot_observed_at":"2026-08-12T15:01:17.182203Z","submitted_at":"2023-03-02T04:24:29Z","title":"Preference Transformer: Modeling Human Preferences using Transformers for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00957","snapshot_observed_at":"2026-08-12T20:51:53.196903Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.196903Z"},"links":{"cited_paper":"/paper/2303.00957","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:46179487a7e3ef757a2a203d8c6d2bbf9a7e49c836fe6a9fd0fea9314dc53bbb","observation_id":"d11b751f-1c02-46ca-9c8e-d1027f6df6b0","resolution":{"observed_at":"2026-08-12T20:51:53.196903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-12T14:28:10.961989Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T20:51:53.201652Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.201652Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:366906329b977eb0f1d4efdf0fd306f861b59147fbd3e4f82636ef0cf2c2b10b","observation_id":"d4390c02-6ff5-4328-ba88-08fc5c607b18","resolution":{"observed_at":"2026-08-12T20:51:53.201652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-12T20:51:53.206287Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.206287Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:4c3750e14e16af3f039367fc470f0ad2f70e23c4d265b344fc6915300ad0d5d3","observation_id":"a3fd12f4-8589-4611-b78f-e21d994e7d5c","resolution":{"observed_at":"2026-08-12T20:51:53.206287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.210920Z","title":"Y.; Russell, S.; et al","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.210920Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:2d69c06dc04c661e4def123e4056f667cecd05f22799a08b926b2e50b5ae64aa","observation_id":"0f3beb00-962d-4a3c-95e5-dc13be36a4b0","resolution":{"observed_at":"2026-08-12T20:51:53.210920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.215100Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.215100Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:851e78a3d02d1978bc773a03cbf08f5f73c79ac235c659d8ad306ec254ad86fb","observation_id":"a410275f-acb1-49cb-8dd7-7e14af80026c","resolution":{"observed_at":"2026-08-12T20:51:53.215100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.219371Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.219371Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:4dd8eb58b7a1b1e7b2f42117bbfe00a55c98c0941b3a47011d4d0a10019d70fd","observation_id":"ede472ff-1e61-4887-b132-1679e2df341b","resolution":{"observed_at":"2026-08-12T20:51:53.219371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.223593Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.223593Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:1be34e0b615d7496f5fc572038a761ac95d9c8eebddbad5e15ab5c573b15470f","observation_id":"92eb5f4e-8d06-4743-acbe-ff91a888c7b5","resolution":{"observed_at":"2026-08-12T20:51:53.223593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.227840Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.227840Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:8942431d958aa91c5c6fe52cfaaafab0be6edf41f06dcc9d4067531dda6a038a","observation_id":"59597ecd-d41a-4535-a1cf-a4ef9e0c76e0","resolution":{"observed_at":"2026-08-12T20:51:53.227840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.743733Z","title":null,"venue":null,"work_id":"6245db95-e1e6-4fbd-a4f7-26c5f06c999c","year":2016},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.232500Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:3ad415faa3ffe57309c557f76edec9bdff1221f1dd4153eab76cd24e08622d8a","observation_id":"4d466063-c013-4035-a85b-dba08fc55272","resolution":{"observed_at":"2026-08-12T20:51:53.748521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T20:51:53.236719Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.236719Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:2bcc5b52dd5d8548dff5bf4f2220821f4d5567e6c2f5831460ff2e68bbc710d4","observation_id":"a4512eda-ed6d-4102-8cf3-c51b8e3cd1fa","resolution":{"observed_at":"2026-08-12T20:51:53.236719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-12T04:33:19.051860Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-12T20:51:53.241261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.241261Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:868a66778a9a33e76f999d0cc7373ebbe111ec2eaa7de992a1abaa77f8440891","observation_id":"88c54870-04ac-4b88-88ed-0e746332ae9e","resolution":{"observed_at":"2026-08-12T20:51:53.241261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.245842Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.245842Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:fb8d3c041f9d7d1c25376ae38a1790bd58684661229e90083cc57a9ddc875041","observation_id":"64667873-9296-4c99-8cca-8b6df2649084","resolution":{"observed_at":"2026-08-12T20:51:53.245842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.250055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.250055Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:045aa1cfc2312ed7c2277309474d6bd916f26e50c67583af3a6f399388b8206f","observation_id":"d98f7b19-1569-4d91-a1bd-3423859b9ecb","resolution":{"observed_at":"2026-08-12T20:51:53.250055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.254243Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.254243Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:5407e18f7c265d30f094fcc4bc48d6c965aa8c6f87a2237b78c9efb6063c4bea","observation_id":"3e5b2aec-a4b9-4f0f-a803-cab55c4a8a75","resolution":{"observed_at":"2026-08-12T20:51:53.254243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-12T23:58:42.219979Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-08-12T20:51:53.258371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.258371Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:26ffd4a26a67a2ad6a936f673f82e5b2bdf79c6efa0c4a97383eda0eb24caddd","observation_id":"b34079ab-483f-49e5-9763-b1af369a2c45","resolution":{"observed_at":"2026-08-12T20:51:53.258371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.702128Z","title":"T.; and Pal, C","venue":null,"work_id":"4e86617f-e9c0-4d19-b64c-818b5947d734","year":2020},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.263108Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:17b6a176ce9156f7f0f61f0d4242806178f8972a8b0d8b842ae362a0d0e275b4","observation_id":"17c4dcee-5634-4571-a3c4-435e1c433264","resolution":{"observed_at":"2026-08-12T20:51:53.706679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T20:51:53.267579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.267579Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:9006ad58dbfb49f2083fef828dc1042bafa563b49af918e97882fd811df1d4d0","observation_id":"1f864896-899f-46a8-849d-b6da04f8975d","resolution":{"observed_at":"2026-08-12T20:51:53.267579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.272018Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.272018Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:ab967df96a6414a0a4cbab6e8011c6bfc31030248f7664ddfaa25ccb41b48ddf","observation_id":"6ba8518f-d633-4edd-ab5b-951a2990b1d9","resolution":{"observed_at":"2026-08-12T20:51:53.272018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-12T20:51:53.276407Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.276407Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:44c5e9b87c535d1cc9eed812165c9c22da5c0cd7ca4dc27a8c6376c42ba95911","observation_id":"23ffa5b9-7eaa-41c1-83b8-fbf772db50e8","resolution":{"observed_at":"2026-08-12T20:51:53.276407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-12T20:51:53.281213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.281213Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:2a3cc0f86b210bce60ef639cb2237871fbf924d6957028874c3bad6c44bf8e87","observation_id":"853c1f88-dd45-4e82-9661-9e8fb6cff1a9","resolution":{"observed_at":"2026-08-12T20:51:53.281213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-12T18:27:33.686313Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-12T20:51:53.285782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.285782Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:a3fa200a513ca3880e7eba0315dd287d3d12c5c9b196d1e8b492b13220511781","observation_id":"2dbe5ef3-bce9-423e-8da1-daa8ebc825c6","resolution":{"observed_at":"2026-08-12T20:51:53.285782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05171","last_updated":"2024-07-09T13:17:36Z","snapshot_observed_at":"2026-08-13T00:59:27.177792Z","submitted_at":"2024-03-08T09:20:12Z","title":"Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05171","snapshot_observed_at":"2026-08-12T20:51:53.290159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.290159Z"},"links":{"cited_paper":"/paper/2403.05171","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:8203e7c902ceb9cc975fd16c1051ef8770c960da41f6c820ab7efde3a545a8ef","observation_id":"64db0c9c-9e6c-4e0c-b0ab-cb8c096fa715","resolution":{"observed_at":"2026-08-12T20:51:53.290159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00536","last_updated":"2020-05-02T07:09:50Z","snapshot_observed_at":"2026-08-12T12:35:17.076560Z","submitted_at":"2019-11-01T18:16:54Z","title":"DialoGPT: Large-Scale Generative Pre-training for Conversational Response Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00536","snapshot_observed_at":"2026-08-12T20:51:53.294752Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.294752Z"},"links":{"cited_paper":"/paper/1911.00536","citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:231ee92501566abb0566f2e3f15615d373d6c857df4a1dc1fd909338cd1e9d96","observation_id":"59bd2236-d0c8-4a6b-bd09-72a228229ad7","resolution":{"observed_at":"2026-08-12T20:51:53.294752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:51:53.676796Z","title":null,"venue":null,"work_id":"27580b62-d8d0-4d4f-a216-7dadcdcd34fb","year":2018},"citing_paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T20:51:53.299361Z"},"links":{"citing_paper":"/paper/2411.09341"},"observation_digest":"sha256:bf245215eeb595d0398f559210432d832ba7bfb5a11434e2d7ce5031f81841cd","observation_id":"f8e0967c-79b7-4f8f-bf22-c139f106c22d","resolution":{"observed_at":"2026-08-12T20:51:53.682392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09341","last_updated":"2024-11-14T10:37:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T02:13:47.855912Z","submitted_at":"2024-11-14T10:37:34Z","title":"Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2411.09341."}