{"as_of":"2026-08-22T22:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5a192a2356090707ed44b69d0af3c770135fa3965b53e2ad8fb490cc510f582","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:36:36.447560Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18654/citation-record","integrity":"/paper/2411.18654/integrity","json":"/paper/2411.18654/citation-record.json","paper":"/paper/2411.18654"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T11:36:36.261063Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.261063Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:73aea7cc35f5e60cffa9b2b2fdcfcc307b9bc651b5b8ca0145611092469e4786","observation_id":"11bf1fa5-15d6-4f09-a254-22732f9f8bad","resolution":{"observed_at":"2026-08-12T11:36:36.261063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.266346Z","title":"Text2action: Generative adversarial synthesis from language to action","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.266346Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:e6427cdf83d20d508b6482dbefcbed1abbd042a0f93ad2706387b05774842c3b","observation_id":"0fabde44-4aa1-4b20-b3d5-a424287e8d50","resolution":{"observed_at":"2026-08-12T11:36:36.266346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:37.018944Z","title":"Lan- guage2pose: Natural language grounded pose forecasting","venue":null,"work_id":"ac85ae44-4ebf-4f06-a4ff-a14af388ad68","year":2019},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.271494Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:005d471e13654ba050508529e9900ea4f1d11e1fcba02502c8d6f0649144a1bf","observation_id":"e9f58cfb-5d48-4a1e-b980-266b26f6b36f","resolution":{"observed_at":"2026-08-12T11:36:37.023300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:37.003420Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"37bd2220-768e-42d4-91b3-1be6e2ee854c","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.275358Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:7724488fe535b782d970effe53ec9b876dce03c67c51dcd1228ed4c289e47607","observation_id":"3431954e-fd16-4365-8ae5-9c0a8f8e14a1","resolution":{"observed_at":"2026-08-12T11:36:37.008372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.991442Z","title":"Teach: Temporal action composition for 3d hu- mans","venue":null,"work_id":"986e3edd-8867-477a-bdaa-9b91a5ab1446","year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.279211Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:9ac31abb1dcafcfec4dd983c2f7c9511440788cf353892c7a1c2267a94d7c660","observation_id":"22bf2dd3-5534-4c52-8e7f-c6e802725e47","resolution":{"observed_at":"2026-08-12T11:36:36.995311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.979331Z","title":"A general theoretical paradigm to un- derstand learning from human preferences","venue":null,"work_id":"554c60d6-aa5c-43ba-8dd5-fc8b94404d07","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.283707Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:cfcf6e20c5f3b3a6acf70a10716c1a0e837e9ab9a28200dc32818269733138d1","observation_id":"d2d71697-00b5-41b9-91b2-be0cd0f417f8","resolution":{"observed_at":"2026-08-12T11:36:36.983538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T11:36:36.288168Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.288168Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:81d20f91a2c8e0db1d44aa819ae885767ef8466678b532d2b555cc4eb69da60d","observation_id":"b7bbcdb7-2317-4288-8a50-45d50897d641","resolution":{"observed_at":"2026-08-12T11:36:36.288168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-12T11:36:36.292953Z","title":"Con- stitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.292953Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:4d80b09c34636473e0cbadd6456bc41b23680cacd012f815b36931fa6d6d9bfb","observation_id":"2cfeecc8-d8ed-45fc-adda-9f34d03667cd","resolution":{"observed_at":"2026-08-12T11:36:36.292953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.967105Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":"3aeae883-a41a-4fc0-8c05-d5bd907a58bf","year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.297338Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:f979ada7871aa0bdb64b79081fa01988ace768fdd91c8f470a383259685775f6","observation_id":"434cfae0-4860-4c9f-beb2-614a961bfc45","resolution":{"observed_at":"2026-08-12T11:36:36.971641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.947970Z","title":"Synthesis of compositional animations from textual descriptions","venue":null,"work_id":"e671a20b-2803-4fb0-8a59-c12194cebd41","year":2021},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.301729Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:1dbf992b1211f8aff0de3269b28a270d052a8927925e0b439a20df223a0fa4a3","observation_id":"b4f73b8d-a44e-4ea5-84fd-12975e111df2","resolution":{"observed_at":"2026-08-12T11:36:36.952416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.934964Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"ad656b49-5386-4213-baae-253a1c27eaf5","year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.305588Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:c9e95879cfb3bc4b3cb809696ff5134a426506189f1540576d0af4a01b9741a7","observation_id":"74fde757-2ee4-456a-aafb-921d7082eeab","resolution":{"observed_at":"2026-08-12T11:36:36.938738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.923419Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal genera- tion of 3d human motions and texts","venue":null,"work_id":"82a36a68-bcf3-46ae-bec1-312084ba8b44","year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.309373Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:df6801cbed54e3dc548f88b4e2000f075ddedf08d799f095ea9775ca995c6962","observation_id":"f71c9262-418f-4c31-b48e-b8312b3b95df","resolution":{"observed_at":"2026-08-12T11:36:36.927067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.906851Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":"b0dc344d-0221-4e89-b9e6-a6063d9b06b6","year":1900},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.313213Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:ee4c88efe13d38aa120946b32a11ee4bf5c66a5697184fa010ef37ac513fc4e2","observation_id":"1d05a900-6a4c-4208-a9da-b7fcbedbba8c","resolution":{"observed_at":"2026-08-12T11:36:36.915154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T11:36:36.317715Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.317715Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:1f3066c79397bedcf21c1d8bce8d88d7789da30308027f22839cb290b0100641","observation_id":"1a9974c6-6310-44f8-ba60-3d10974bd890","resolution":{"observed_at":"2026-08-12T11:36:36.317715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.893815Z","title":"Motiongpt: Human motion as a foreign lan- guage","venue":null,"work_id":"6eadb80b-6867-4798-916c-1cf228dc0822","year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.322006Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:49d4425202c88d1c3ba95c6f013459d2ed94f1bb66c844eac9389926e6e919da","observation_id":"8af7188d-997e-4fec-9fe8-becbb2bde81c","resolution":{"observed_at":"2026-08-12T11:36:36.897806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-08-20T08:43:12.373190Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-12T11:36:36.326120Z","title":"Aligning text- to-image models using human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.326120Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:2770751f4cb8937d2b823b2bcfa2614bee42e2c0f5787eb34700b82bb3ef6310","observation_id":"c3fc2729-1403-4374-8447-255e388724d6","resolution":{"observed_at":"2026-08-12T11:36:36.326120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.880624Z","title":"Baton: Aligning text-to-audio model with human prefer- ence feedback","venue":null,"work_id":"334911d8-adb9-46fb-81a1-f809f45f9cf4","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.330761Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:9b8aeda4ed8da3d47799e02c903c5e2a4ebb724160e56d1a6b69188fa4890698","observation_id":"0585130f-c05b-43ab-8599-4bfeb6fea469","resolution":{"observed_at":"2026-08-12T11:36:36.885297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.868632Z","title":"Generating animated videos of human activities from natural language descrip- tions","venue":null,"work_id":"adb1cddd-9f45-40af-9955-76a6be7b2675","year":2018},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.334889Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:b35150c05aece8dff5995602c89e04bdb2059832f676920588d1286baea22761","observation_id":"aac945af-18f9-40c3-87b7-46c32ae6e3c6","resolution":{"observed_at":"2026-08-12T11:36:36.872437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.850603Z","title":"Peft: State- of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":"7e4461b6-0f0f-4885-bff8-4d63596f1a6c","year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.338922Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:93d9fbe1f368b96952b0a0765974313dad1e35e3c3fb630b539e067ac9c76b0b","observation_id":"0d314363-fbb6-4997-9d98-7883127114e3","resolution":{"observed_at":"2026-08-12T11:36:36.855613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15541","last_updated":"2024-05-24T13:29:12Z","snapshot_observed_at":"2026-08-22T20:36:46.164518Z","submitted_at":"2024-05-24T13:29:12Z","title":"Learning Generalizable Human Motion Generator with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15541","snapshot_observed_at":"2026-08-12T11:36:36.343250Z","title":"Learning generalizable human mo- tion generator with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.343250Z"},"links":{"cited_paper":"/paper/2405.15541","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:bd7229031c4848e95efe1ad2e74f3933c7b91e09489bffbb8e771ab86097b69d","observation_id":"46d475d0-efae-4274-a0d9-58b9b4a36d0a","resolution":{"observed_at":"2026-08-12T11:36:36.343250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.837720Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"0e63ec95-45e1-4d67-99d7-8e48eaab6d43","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.347648Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:5ecfbb280f0c83243de4af1cf4936fb998af09ee12bf69efb0c142b69b74bfd6","observation_id":"b2595e5e-c029-4f96-8858-74ff827152dc","resolution":{"observed_at":"2026-08-12T11:36:36.841501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.351404Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.351404Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:a8c063966e33edbb952d9156f0d3a850232b7359dbf12ae57e0328bf14f4d763","observation_id":"670e0b1f-cd9c-47d3-bd67-0011be59e58b","resolution":{"observed_at":"2026-08-12T11:36:36.351404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03803","last_updated":"2024-05-06T19:19:20Z","snapshot_observed_at":"2026-08-22T19:34:02.822637Z","submitted_at":"2024-05-06T19:19:20Z","title":"MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03803","snapshot_observed_at":"2026-08-12T11:36:36.354927Z","title":"Modipo: text-to-motion alignment via ai-feedback-driven direct preference optimiza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.354927Z"},"links":{"cited_paper":"/paper/2405.03803","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:54ee52bd6642e360b36acf9aa5b5aa096f03475e47766ccd13027e4583419927","observation_id":"5b1dfac4-df7f-471f-813e-1027c524cb76","resolution":{"observed_at":"2026-08-12T11:36:36.354927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.813109Z","title":"Black, and G ¨ul Varol","venue":null,"work_id":"fa25a350-6aca-4287-8ef1-22edc0ca209a","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.358846Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:5af61eceee9057e3da8657e165ca1acd87898b4b8e9637196e5721a7be0d535c","observation_id":"15b80d2a-3d79-4b4e-88a3-7cfdcc6c6568","resolution":{"observed_at":"2026-08-12T11:36:36.818678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.362862Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.362862Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:dc9b63b05ec6008d292fc6aa1661917949bf385496fa5dd343e36ddf44ec9865","observation_id":"3fc11818-74d7-4f01-8406-d61cac75e70e","resolution":{"observed_at":"2026-08-12T11:36:36.362862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T11:36:36.365791Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.365791Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:1b9e2d0ef7c7877557a632d69d02436ba117b44a6e91d6f15781553398411736","observation_id":"fa99a03d-8533-40f4-b015-9b0ecf1185db","resolution":{"observed_at":"2026-08-12T11:36:36.365791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-08-12T18:48:37.916493Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-12T11:36:36.370247Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.370247Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:e294000b1adc631daf81f69ec1fbb80d86461260dcdf4248d40adcbbb1565f24","observation_id":"69d572c7-78d9-4753-b5fa-2ee51e1ce13f","resolution":{"observed_at":"2026-08-12T11:36:36.370247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01418","last_updated":"2023-08-30T04:41:10Z","snapshot_observed_at":"2026-08-22T01:17:13.968669Z","submitted_at":"2023-03-02T17:09:27Z","title":"Human Motion Diffusion as a Generative Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01418","snapshot_observed_at":"2026-08-12T11:36:36.375237Z","title":"Human motion diffusion as a generative prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.375237Z"},"links":{"cited_paper":"/paper/2303.01418","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:0c49ca4b6965f17d425a73c3e64dac0a433c43d6db85aa4825187a71638fe6ad","observation_id":"a417bf18-83c2-483b-862f-5f0a7ee0e4a7","resolution":{"observed_at":"2026-08-12T11:36:36.375237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.792829Z","title":"Exploring text-to-motion generation with human preference","venue":null,"work_id":"ac4dde05-5785-45b5-856d-2560bef2c15f","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.379577Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:9f56b4e661e03d0e5dff123499bedf23b03d283d1a3ff059560b44aa2ce65609","observation_id":"8039d85a-016b-4e8b-9f2b-d42f29d463b6","resolution":{"observed_at":"2026-08-12T11:36:36.797778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.383735Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.383735Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:f3db749ce0aad6f320d1e0e9075c574a36e372187044b4b04f008cd73d24d677","observation_id":"c35c5f8c-672b-4815-9723-ea2ad1a812d5","resolution":{"observed_at":"2026-08-12T11:36:36.383735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-16T13:05:06.623461Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-12T11:36:36.387786Z","title":"Motiongpt-2: A general-purpose motion- language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.387786Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:2e28b6c11fb490b8ca242c87605ede39be08badefee27103ddbe7519dee23063","observation_id":"9d088b05-92da-4506-a208-bf1406735105","resolution":{"observed_at":"2026-08-12T11:36:36.387786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.392207Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.392207Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:9d8bfcb4c88cbeca0a426733b87eb0b4f449a2b4b21922ecd234728d8d369df6","observation_id":"d993d3e2-3e27-4042-8d3f-42c7e1ba1d5f","resolution":{"observed_at":"2026-08-12T11:36:36.392207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.765159Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":"1728252a-f9c3-4fe4-b4a8-cfc9b6572769","year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.395919Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:20164178bde50580621b3f9297440fe15e20a066190a639a9b97855d8e5f59d4","observation_id":"3b9cc144-599f-4fab-b0ce-1e617172c4ee","resolution":{"observed_at":"2026-08-12T11:36:36.769754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-16T16:35:36.335456Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-12T11:36:36.400357Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.400357Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:4c17c795c3511314e84b73ec5288ec352c236c663a4aea34b92dcb31fc3838d1","observation_id":"2fbc7b1d-4244-4c2e-bdb0-39b6f6fbb6ca","resolution":{"observed_at":"2026-08-12T11:36:36.400357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.404294Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.404294Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:33fd4abdf790715ae02c3505619afa7464f00b7900726844560d7b43995675e7","observation_id":"18c2c780-c64c-42c3-a58e-1de0b174fe78","resolution":{"observed_at":"2026-08-12T11:36:36.404294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.742712Z","title":"Temo: Towards text-driven 3d stylization for multi-object meshes","venue":null,"work_id":"9849774a-196e-4cff-895b-1184d5e46bd2","year":2024},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.408788Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:27890175f0daed21c927387ecb0cd00cfe9559878ffc87815d9e65b90b65733f","observation_id":"942cb4b9-3563-4e3e-be0e-60173e01bcf4","resolution":{"observed_at":"2026-08-12T11:36:36.747450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-20T10:41:24.815766Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-12T11:36:36.413997Z","title":"Slic-hf: Sequence like- lihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.413997Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:118fdee67ec262bf092f29113cad481fd068f7a164aab982c91791b0d12779ce","observation_id":"908931f4-5777-4768-a9c5-6f632332c655","resolution":{"observed_at":"2026-08-12T11:36:36.413997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-21T16:54:14.450108Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-12T11:36:36.419130Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.419130Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:2e06ab7f64c976a2f20b9fee0e67553cb3de3af90187d1ad0a2042f5076abfda","observation_id":"dad936b6-a080-4587-af88-6414f678f295","resolution":{"observed_at":"2026-08-12T11:36:36.419130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.728212Z","title":"a person walks forward, turns around, walks backward, and then squats","venue":null,"work_id":"eb809186-4d64-4cae-b376-366218a0792a","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.424161Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:50391304cbaebcff4ff6f2e22f83e86927c02705840003d4a8882e22734269c3","observation_id":"00b8d620-29e3-4d29-9485-f571aeb7138d","resolution":{"observed_at":"2026-08-12T11:36:36.733152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.715448Z","title":"Event1, Conjunction1, Event2, Conjunction2, ..., Conjunction4, Event5","venue":null,"work_id":"d3a70b93-c0fb-4aeb-b262-f77f645bd06c","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.430325Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:1f3992f1b724c8100db89a1a4b3e615cdc15a618721221a56632d852b21070c1","observation_id":"e64b8865-d3dd-4c7c-b32e-6c13f8f85542","resolution":{"observed_at":"2026-08-12T11:36:36.719831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.703799Z","title":null,"venue":null,"work_id":"ab0934d8-f14c-42cc-8b10-763f934a6189","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.436586Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:a5017138dc2ed754560cea38ddf6c794612faa92bd7ef3d8ce4ef7d121742fdd","observation_id":"cc51935b-4dad-4109-bd7e-2a0ca69bcbf6","resolution":{"observed_at":"2026-08-12T11:36:36.707831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.691058Z","title":null,"venue":null,"work_id":"6532eb4e-a5df-4522-b8ca-ab8f2e3c1e73","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.442866Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:61b6836053f3062057eb087c9f97f7a9304848b2e1f4482e753fe26a24dd4d0a","observation_id":"b4ba40b3-3891-44de-8fdb-70985b24f8d9","resolution":{"observed_at":"2026-08-12T11:36:36.696250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:36:36.673250Z","title":"Equivalent Quality","venue":null,"work_id":"25770e86-3578-4df7-aca9-ed0543631e3c","year":null},"citing_paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T11:36:36.447560Z"},"links":{"citing_paper":"/paper/2411.18654"},"observation_digest":"sha256:6e855a61d7bf177abcb3ad14c66b3427430ac56aa5c17cb6f10616bd0964f332","observation_id":"82c50662-6178-4bc1-97b1-2bd30c6f5148","resolution":{"observed_at":"2026-08-12T11:36:36.680469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18654","last_updated":"2024-11-27T05:32:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T19:36:03.136176Z","submitted_at":"2024-11-27T05:32:18Z","title":"AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision Reward"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2411.18654."}