{"as_of":"2026-08-11T01:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9e15e4e6fb9bce2cd1e8979f7d2b730c0e43a5990bec7cf9e28e9a52eea225f","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:55:28.944960Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:06:47.301483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T22:20:22.357042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11144","snapshot_observed_at":"2026-08-05T20:06:47.301483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-08T07:02:19.422958Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:47.301483Z"},"links":{"cited_paper":"/paper/2506.11144","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:def29c05727a767258559369ce647579bd26c31c4757ffd4d03b60a6e96d53bc","observation_id":"80b09f0d-f1bb-4a0f-88ba-5793b7779ac2","resolution":{"observed_at":"2026-08-05T20:06:47.301483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"cited_work":{"arxiv_id":"2506.11144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11144","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alignhuman: Improving motion and fidelity via timestep- segment preference optimization for audio-driven human an- imation","venue":null,"work_id":"33a3bd64-e18d-49ea-bcef-9bf451b34768","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2506.11144","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:d7676d83c35f6ebfff1e3984a21e608ac65d2626f4abc232bef1062936b39718","observation_id":"2220945c-701f-4271-b0de-e9a73bb81630","resolution":{"observed_at":"2026-05-15T22:20:22.360892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11144/citation-record","integrity":"/paper/2506.11144/integrity","json":"/paper/2506.11144/citation-record.json","paper":"/paper/2506.11144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.694299Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.694299Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:21bdda038f1ab86337788f7690da54be1bef819c1710a0626d411fbc856313f2","observation_id":"fd8d86da-6153-4bef-a97b-4378a606b53a","resolution":{"observed_at":"2026-08-07T04:55:28.694299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.699706Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.699706Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:4beb6992db308e105de13218f4da5d677779ed63424ca6f13cf2c54f142695b2","observation_id":"1fa5b9a3-079e-49ef-af72-95a0684e3a38","resolution":{"observed_at":"2026-08-07T04:55:28.699706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T04:55:28.705104Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.705104Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:164d8bb90dcf0804d0ac10705009bfd7cf53b21cda31a19d78f3175f50338080","observation_id":"59b2f9db-ad79-4432-bd5b-8233d8d2d7e9","resolution":{"observed_at":"2026-08-07T04:55:28.705104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.932685Z","title":"Echomimic: Lifelike audio- driven portrait animations through editable landmark conditions","venue":null,"work_id":"4736b263-2556-4eca-b58b-fd20274b8416","year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.710520Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:aa82829de2c34a4b131f193a125479af3505d24d2984a2f034c7d88a013ee737","observation_id":"4b8ab91f-1943-4a55-96c5-781a00fd4a7b","resolution":{"observed_at":"2026-08-07T04:55:30.991079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.715503Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.715503Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f606cee079a5108815cb5a304e179bf3a45eadf619797f0148094f6b23fc2df5","observation_id":"31c0ca70-889b-4879-8337-4a1f37d8e2dd","resolution":{"observed_at":"2026-08-07T04:55:28.715503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:55:28.720484Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.720484Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e1aee47e00cbe7f1260b63f73ca745d1e7aba31a65675d5f8036d7a7b9c85ba9","observation_id":"8fa74461-f8fc-4e81-820f-7b24069f5283","resolution":{"observed_at":"2026-08-07T04:55:28.720484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-07T04:55:28.726179Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.726179Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f2626539c726a457581d0332b9e8675ca365dee7a0372c40955ce39617c3bb6e","observation_id":"ccbba998-7073-4628-b767-729d3c09c679","resolution":{"observed_at":"2026-08-07T04:55:28.726179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.731300Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.731300Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:99c2cb87d24add2b7bdfd511dec860b3efc5f9219a7eb2c262f654a893899512","observation_id":"332b2d9a-3fe5-4db6-b829-f34eee398ab6","resolution":{"observed_at":"2026-08-07T04:55:28.731300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.627456Z","title":"Diffted: One-shot audio- driven ted talk video generation with diffusion-based co-speech gestures","venue":null,"work_id":"b4e7564d-96d1-4062-9323-0299c8e36998","year":1922},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.736426Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:05a113c859756bee26c892d772960122ad683ffea1da61d2e4a067f291f02f50","observation_id":"0a64a6aa-ae2a-4e2d-ac61-1cd4ad56309a","resolution":{"observed_at":"2026-08-07T04:55:30.764884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.472716Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":"4802120b-4663-469a-ab7f-7ea6eab06128","year":null},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.741288Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e4ac7966a60d36fb70b4c776a2f3ce2ecbaf287236278b1c3e473f52982fe845","observation_id":"f3cb1880-620a-49d7-abef-6e4645e6b613","resolution":{"observed_at":"2026-08-07T04:55:30.549854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.746899Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.746899Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e7c66b4eb5d75a6b396f70899018ad4655568f553dd03d59f382ba15d723ed0d","observation_id":"4de104e3-24dc-47c3-9f22-8e2c4e85cdc7","resolution":{"observed_at":"2026-08-07T04:55:28.746899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.751488Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.751488Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:b08c6f916ba241b302f9c0828ed62b18ff648ba377edb2697e4de92ba66fb384","observation_id":"14601b1c-aea7-419d-99d0-34d6dd353218","resolution":{"observed_at":"2026-08-07T04:55:28.751488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-10T09:33:42.290137Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T04:55:28.756180Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.756180Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:62e5bfff01b24e96b0eb0917d1d33b11b262f689d6ed3903713d4c4f533d1081","observation_id":"40ef71f1-9dc5-4609-b324-a1291948ba06","resolution":{"observed_at":"2026-08-07T04:55:28.756180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-08T11:19:14.293609Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-07T04:55:28.761207Z","title":"T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.761207Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:db736bca84e513951ea1f6277f2cad564fe9b0794c00b66c26f8c7ad7fec4ebf","observation_id":"fd030be6-b309-445a-b29d-afe56d43af43","resolution":{"observed_at":"2026-08-07T04:55:28.761207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.291743Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":"70026623-6c7e-4275-9411-fbcc1219731d","year":null},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.766234Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:0dddeebda8fddb7f7177d4bc7fa8553ac363aa5ca37444a5a33181afeabca36c","observation_id":"55c403f1-9e1d-4dc4-8708-d78ecdbdda0d","resolution":{"observed_at":"2026-08-07T04:55:30.352728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-10T13:26:51.589421Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T04:55:28.771375Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.771375Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:2a2e10c33c26529ac59e639be88f1fe7d5a55e61424f45189543f897805b26da","observation_id":"6e47c66c-d5ac-4cfb-81e4-cd383f6c223d","resolution":{"observed_at":"2026-08-07T04:55:28.771375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T04:55:28.776489Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.776489Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:1097fcd8bb01987e29bd05ca7284649c1648bb43c72327509064c3590a8925c2","observation_id":"3ec72267-a68f-48f7-bd25-d5955335aa6a","resolution":{"observed_at":"2026-08-07T04:55:28.776489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-07T04:55:28.781462Z","title":"Improving video generation with human feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.781462Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:97d3ecd7e0c05c670eebb99fbd49286609eacea92b850dd655f352455633ff66","observation_id":"a37f8ded-f857-4f57-9170-1f9ee3402428","resolution":{"observed_at":"2026-08-07T04:55:28.781462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14167","last_updated":"2024-12-18T18:59:49Z","snapshot_observed_at":"2026-08-09T07:20:53.172443Z","submitted_at":"2024-12-18T18:59:49Z","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14167","snapshot_observed_at":"2026-08-07T04:55:28.786930Z","title":"Videodpo: Omni-preference alignment for video diffusion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.786930Z"},"links":{"cited_paper":"/paper/2412.14167","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:1fbdefdc562896f78f4eefa388f9a31836dff6e2cbf738f4486b5dac1c0540df","observation_id":"b3b91f74-c925-4196-a87f-0d3bf56f71de","resolution":{"observed_at":"2026-08-07T04:55:28.786930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.791865Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.791865Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:13c90bee8683b5f12eadf8203c52498436081a369be2c1c4c762b3b5a533a5d1","observation_id":"eaee10a4-b814-4bed-be3d-ab01b6ab6454","resolution":{"observed_at":"2026-08-07T04:55:28.791865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T04:55:28.796700Z","title":"Openelm: An efficient language model family with open training and inference framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.796700Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:fdcd3828e61fb8d156b8e461c3446955d644b4cc8cf8a9ea0394abc966c50217","observation_id":"67473cb3-1792-452b-b3c9-f9add8a36d7b","resolution":{"observed_at":"2026-08-07T04:55:28.796700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.801724Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.801724Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:04bcb610f1246c82d9931e91f0df32a4ca1d286d6341c4d6e9be3426a1387f62","observation_id":"5df5be53-4302-4b5e-aa28-5d2486ae2e29","resolution":{"observed_at":"2026-08-07T04:55:28.801724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.806487Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.806487Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:d0564b3cddd7020b3b8b20c9b5cb839d64095ba808ffb6e11c42ebaba95c2536","observation_id":"55458c22-2b77-4943-ab82-be5c5862081f","resolution":{"observed_at":"2026-08-07T04:55:28.806487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.132896Z","title":"Clip-dpo: Vision-language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":"d54391c2-5260-4c1f-9133-320b3438b3c0","year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.811290Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:5db22ee4587ffb46bc06f4d2151ffa636aee98eaba5483f4d737a2fe2003273b","observation_id":"560225d4-646b-4d12-8ba8-9bf455d38ca6","resolution":{"observed_at":"2026-08-07T04:55:30.211552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.816015Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.816015Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:dc3b6d9694c235b7a447c30034d72376dfcea66fce7f8136435a20cabb2e0c90","observation_id":"d0e261d7-f504-4929-bf90-a71fd56def66","resolution":{"observed_at":"2026-08-07T04:55:28.816015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-10T13:10:46.349703Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-07T04:55:28.820779Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.820779Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:33a32929f9b5cff3505011c656521fd0839423fb9bc2e9166b7ff139dbedce92","observation_id":"f412f38c-0a59-4fe2-a4e8-94f7499ef526","resolution":{"observed_at":"2026-08-07T04:55:28.820779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.826201Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.826201Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:a75d7805068575add6946f1da1407ccecaa9ba9273a44906a5a8db8ccc3cd160","observation_id":"2f1fd874-d2a5-4f25-aaa8-6e7570cbc331","resolution":{"observed_at":"2026-08-07T04:55:28.826201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-09T05:24:50.195241Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T04:55:28.831101Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.831101Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:ce15d977bde18aa89603a375ab92d8f4299584749b5ed7ff580c1dbbb8357f53","observation_id":"53c8f23a-562d-4125-af33-9fd5bf8e15ed","resolution":{"observed_at":"2026-08-07T04:55:28.831101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.836232Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.836232Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:74e781990e13ad1c88ab313496ec935f818fb3a5699869744ae8b25d5a23631b","observation_id":"84fdc69f-6180-43d1-82f3-e60177f829ef","resolution":{"observed_at":"2026-08-07T04:55:28.836232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.936617Z","title":"Motion repre- sentations for articulated animation","venue":null,"work_id":"4373374d-36b8-416f-a13e-0aa7f2f8122a","year":2021},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.841312Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:8b6a1933eaee4f5682e0ad5d51ca2c02b21cd80a4e57895deeabf37795d28b3a","observation_id":"eb78e81a-9ec2-45fa-aa05-8f363e9ed10a","resolution":{"observed_at":"2026-08-07T04:55:30.020083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.846144Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.846144Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:980c2c033b0178326a668b1003af44bfc810bb5a23754a197baa465a13fb4166","observation_id":"c0e90711-c221-422b-9c4c-c10a9716e5ee","resolution":{"observed_at":"2026-08-07T04:55:28.846144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-10T18:59:30.199107Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T04:55:28.850843Z","title":"Emo2: End-effector guided audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.850843Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:94e764e1c3a6fb1acfb5aca3c0f9283efb886806c1864ba22e306999e83b90fb","observation_id":"71ee290a-41c2-40a6-a35c-52be9b948044","resolution":{"observed_at":"2026-08-07T04:55:28.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.855934Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.855934Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:919cd3dcb2130175ee3a6401f6f7c1470e51e0bafe7e4d1a4db20ef15ffa7bdd","observation_id":"3317897e-905e-4580-b747-3b0fcb39c634","resolution":{"observed_at":"2026-08-07T04:55:28.855934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.860592Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.860592Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:194ddb1fee855ea3705c17709567ee5b5e282e394570132226178540e34ef8a7","observation_id":"3b28877d-56fe-4a91-9b86-b40291324f9c","resolution":{"observed_at":"2026-08-07T04:55:28.860592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.865734Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.865734Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:499f2f7353d34ad9703f202976c2ac3e5d6f9ef3f2b464a43bd83aa1a3793614","observation_id":"812fa1c1-c70e-4371-a564-bfb6b70afd5c","resolution":{"observed_at":"2026-08-07T04:55:28.865734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.870532Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.870532Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:ca7e447838d2dcd770aa7ffaa6f4049bb8666cba8ddc25550109dfc0c5292b64","observation_id":"9de4a076-298c-4f18-845f-79c9c37e7b38","resolution":{"observed_at":"2026-08-07T04:55:28.870532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-09T02:00:54.345290Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T04:55:28.875127Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.875127Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:ba8496855bc764e054ddc8a0b851b106467300e70df11b89a32d385132483eb8","observation_id":"ab4b4deb-7c2c-47d2-8177-452149814295","resolution":{"observed_at":"2026-08-07T04:55:28.875127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:55:28.880281Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.880281Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:dd98713ae36195ae16eb317422d14c90a9a01cd1a08020cb1fe4bf9ccb3fce8d","observation_id":"9c039a11-5378-406b-8f97-09dfc2d9857c","resolution":{"observed_at":"2026-08-07T04:55:28.880281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06601","last_updated":"2018-12-03T15:12:44Z","snapshot_observed_at":"2026-07-06T06:56:30.962909Z","submitted_at":"2018-08-20T17:58:42Z","title":"Video-to-Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06601","snapshot_observed_at":"2026-08-07T04:55:28.884977Z","title":"Video-to-video synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.884977Z"},"links":{"cited_paper":"/paper/1808.06601","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:bde6fdd395543ddf1c4086d4717239814ef68f8ba55c9cf12de1009a973e1cea","observation_id":"66d15514-4ce7-4003-b194-d045990134d5","resolution":{"observed_at":"2026-08-07T04:55:28.884977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-07T20:48:48.663695Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-07T04:55:28.890139Z","title":"Mocha: Towards movie-grade talking character synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.890139Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:dcbcb81d12ed5f45012c59865bc418677cca47d92f8495b38f76ae1100392806","observation_id":"31529f22-2b38-45ac-bb66-f124081eb677","resolution":{"observed_at":"2026-08-07T04:55:28.890139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T04:55:28.894940Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.894940Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:3c5eb4f0c5c1e070867ee6f8576a70a8c5e2216529e14771aa109d313a6509e5","observation_id":"3623e821-9b74-4eb0-8bca-2c23fbf8d40c","resolution":{"observed_at":"2026-08-07T04:55:28.894940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-11T00:30:13.593181Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T04:55:28.900227Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.900227Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f3fa95e558596624da2294377645892f0d933ee073dac5f37d91367f84c77c8b","observation_id":"b96501ee-2d9b-4a1d-b447-6e00bd365e02","resolution":{"observed_at":"2026-08-07T04:55:28.900227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-07T04:55:28.905535Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.905535Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:27699a9c022fd84f9b5c6fab1f612639a0b95fc6fb6a314d180a7056ea5d33bf","observation_id":"02dfe58c-2446-4726-9098-ea9aa4e97b5b","resolution":{"observed_at":"2026-08-07T04:55:28.905535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.910579Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.910579Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:8d55cd9f4c3bfd4306b8930850df843ba703eb978fe36c062dcd3a0cc8079540","observation_id":"973dce22-a8ec-4689-adcc-bebf3488a4f9","resolution":{"observed_at":"2026-08-07T04:55:28.910579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T04:55:28.915211Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.915211Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:fcf1bd8e9aadda0748d4f4db339207e2db500c4b1357fac6e5453099fe90031a","observation_id":"f8b87c68-d613-4395-a5e6-d84a82c53b51","resolution":{"observed_at":"2026-08-07T04:55:28.915211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T04:55:28.919921Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.919921Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:9fa69b18d9de4c38f6287054138bd9eb2e90840ce8e4700071458ad0a6ec718e","observation_id":"38fb32d1-51cb-41d7-a3e7-27574f913fd6","resolution":{"observed_at":"2026-08-07T04:55:28.919921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-07T17:20:57.588862Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T04:55:28.924931Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.924931Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e288e988b1ab3a4ffaf60d2bba558bc947881dfe5889a35bbd8074285dec1ab4","observation_id":"91a34f10-0f46-42b2-b700-0a2d7e954b6b","resolution":{"observed_at":"2026-08-07T04:55:28.924931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-09T19:19:40.842650Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T04:55:28.929697Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.929697Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:bb0862457a34cea5062a7cc30dec7d63dc45f2b739f1ddba5c5c2a6cc7aafce8","observation_id":"43bb5afe-d99e-421f-b48d-a980d648cfd6","resolution":{"observed_at":"2026-08-07T04:55:28.929697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.708516Z","title":"Learning to compare for better training and evaluation of open domain natural language generation models","venue":null,"work_id":"bc9bb985-66be-42e7-bd60-fb4906c24bf4","year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.935045Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f00e3d80686459dfaf39d71e34c571455d1f646c9639392e76bc42af59311a28","observation_id":"cf331162-f1b4-4f4e-a36a-2d3f7c10ba00","resolution":{"observed_at":"2026-08-07T04:55:29.765277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.940019Z","title":"Taming diffusion models for audio-driven co-speech gesture generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.940019Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:493174a804b330a1b7358ab528f1e8783e5f16a7de29cd5fbd1c568e2c1e89b9","observation_id":"81a56989-01fb-48eb-b3bd-a3f7b69ee758","resolution":{"observed_at":"2026-08-07T04:55:28.940019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.560355Z","title":"Vlogger: Make your dream a vlog","venue":null,"work_id":"27298a1c-5ef6-4f4b-afbf-3d2426d41cb4","year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.944960Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:615aaad5e362d51820c4fe20f8460344e4b2d133c566341aa7b39251afc7c28d","observation_id":"4b5ee12e-bb9b-47aa-84d2-20ad52b4d177","resolution":{"observed_at":"2026-08-07T04:55:29.620891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2506.11144."}