{"as_of":"2026-08-07T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3460349ca0287a98f4aff83286f54e411422d094f1e5973e862429c32ea5d75c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:18:12.550250Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01392/citation-record","integrity":"/paper/2608.01392/integrity","json":"/paper/2608.01392/citation-record.json","paper":"/paper/2608.01392"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:09.624279Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.624279Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:ce8d952840632767207aa53d1b7d4e8a464606b6d1eb815fae49765fb67ebef0","observation_id":"1d8eb615-bb3a-4df3-ba8c-b07aaedb640b","resolution":{"observed_at":"2026-08-06T00:18:09.624279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:18.428490Z","title":"Seamless human motion composition with blended posi- tional encodings","venue":null,"work_id":"a57945eb-dc22-4efc-a5db-a8ce7e0c6658","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.694111Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:6e8a0dd6ef004cb10142f7c4d686d7365bbb6fc0658156d59489d60f0b060dc6","observation_id":"1e3ab1af-bc8b-4f09-ae93-eefb8c2ba092","resolution":{"observed_at":"2026-08-06T00:18:18.524741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:18.216470Z","title":"A cross- dataset study for text-based 3d human motion retrieval","venue":null,"work_id":"fed85bf9-117f-4497-83ed-0133b15c16e1","year":1932},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.761688Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:49db1d07e053c65e40dcbd439320bb948ea8153f14a086a85ba6e549650bd3fc","observation_id":"729720f7-9dcb-4e37-bb4f-45cc441c4bbc","resolution":{"observed_at":"2026-08-06T00:18:18.350693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:09.806437Z","title":"Is space-time attention all you need for video understanding? InIcml, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.806437Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:cc3a435a77413df18734276c642d096926b9b1d2a8de60d72990ef87a6b4a262","observation_id":"3f7840b3-31ac-44ba-a1e3-a313f6891a9d","resolution":{"observed_at":"2026-08-06T00:18:09.806437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.973207Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport.Advances in neural information pro- cessing systems, 26, 2013","venue":null,"work_id":"76d8b339-3e9e-4b9e-9e2f-619160877127","year":2013},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.916222Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:53291e07743560e8ef4aa867d0d503c7c8294f28e1d897f7eaf7554c93a9b93a","observation_id":"110b8fd9-c88c-4d7b-a86f-4d4abafa473c","resolution":{"observed_at":"2026-08-06T00:18:18.086343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.768914Z","title":"Segmo: Segment-aligned text to 3d human motion generation","venue":null,"work_id":"31a5dbd0-493a-498e-b4a4-3916b044afd6","year":2026},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.011811Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:8495a1c26dc9e4882cb76ebb74ac357ee6310f1779a8885475467ad9ed47cf53","observation_id":"e1df4d46-a53f-4f95-8e51-83ea6a6c04b6","resolution":{"observed_at":"2026-08-06T00:18:17.845673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.101270Z","title":"Masked autoencoders as spatiotemporal learners.Advances in neural information processing systems, 35:35946–35958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.101270Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:56146fb7e27151e9fe62ed76bd99fb364165dac26a29026ea128c4deef5eea2b","observation_id":"2d8e775e-2337-449d-bacd-e94edbb17081","resolution":{"observed_at":"2026-08-06T00:18:10.101270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.569235Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"3f87b8fb-3c0f-4753-a25a-aeed0d8a2beb","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.184506Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:21af8676d371a229111bc53cd0a294989174e4d5b999818620283ad6cae23ae6","observation_id":"9396af1c-2063-4a0b-af53-c00773747281","resolution":{"observed_at":"2026-08-06T00:18:17.689155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.347769Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":"bfc507a0-80a6-4827-96fd-76801b8e354b","year":1900},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.252169Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:7e6c593cad8062bd06fe499e917e604a3d0f5e2889fc9d6b0641df3d64ea55d1","observation_id":"a814d231-cf1b-4a36-a09b-b2ee7c0b31b5","resolution":{"observed_at":"2026-08-06T00:18:17.448771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.316066Z","title":"Snapmogen: Human motion generation from expressive texts.arXiv preprint arXiv:2507.09122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.316066Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:34616e435f53e41895da21601bfb69d3033d43cc288068b432cc5c79ce02809f","observation_id":"92145b61-a539-4f5f-bc8d-c4f3fe4662e8","resolution":{"observed_at":"2026-08-06T00:18:10.316066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.113085Z","title":"Amd: Autoregressive motion diffusion","venue":null,"work_id":"ea070812-2cd6-4472-8ca0-40ede198abe2","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.394699Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:6bbf9e7168cdcc5b3b5ed523a3643a808a1490a053da908893c6dd555d84311e","observation_id":"dd972f82-f165-447b-93fd-bb7817a4e9fc","resolution":{"observed_at":"2026-08-06T00:18:17.223219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.932212Z","title":"Como: Controllable motion generation through language guided pose code edit- ing","venue":null,"work_id":"2dfb2bed-3f46-4eb2-860b-86efd6129704","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.457611Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:408431a27e84d4e2b117621e58e9db9e4ea6529258a0a37ee9db72cbfb664eb3","observation_id":"da7653cb-97cf-45b6-9b9b-a0f7481e01ed","resolution":{"observed_at":"2026-08-06T00:18:17.019348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.712553Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":"24ae9341-5902-43f9-ab73-d855ac63011b","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.511210Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:3af697b5f8e30b84727c86bdabce57d78edf5ac5eb2f3ba93c8530e613d7dbcf","observation_id":"4fbfc23a-42ea-4035-9321-2186955508ae","resolution":{"observed_at":"2026-08-06T00:18:16.826747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.476431Z","title":"Unimotion: Unifying 3d human motion synthesis and understanding","venue":null,"work_id":"37c6638e-04cb-4620-8f00-b50e1c340fb5","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.609319Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:1d5d3fb2fb4cba80560a388a99d1c18d0fec182759d2eae123d3524ec840ff3f","observation_id":"e9676649-5f43-4969-8a10-99ff725ef267","resolution":{"observed_at":"2026-08-06T00:18:16.656878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.686875Z","title":"Frankenmotion: Part-level hu- man motion generation and composition.arXiv preprint arXiv:2601.10909, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.686875Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:8bce94c8b2b761d46837ef29bf08957de2af76b39224fc2a9f026eb7af6515d4","observation_id":"b6e88d32-1981-45cc-928b-82dd243fa9dd","resolution":{"observed_at":"2026-08-06T00:18:10.686875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.354077Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset","venue":null,"work_id":"f8ba6f9b-0b8b-4d60-85aa-200145740ca6","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.779221Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:9aea776763a5d1595133f58874eefd9c5054bc684b72a61bcf8d7db270584925","observation_id":"0baaaaff-ba9b-4d34-9537-72e342d8d4a2","resolution":{"observed_at":"2026-08-06T00:18:16.419404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16702","last_updated":"2024-01-30T03:03:26Z","snapshot_observed_at":"2026-07-06T17:22:15.248410Z","submitted_at":"2024-01-30T03:03:26Z","title":"Multi-granularity Correspondence Learning from Long-term Noisy Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16702","snapshot_observed_at":"2026-08-06T00:18:10.857069Z","title":"Multi-granularity correspondence learning from long-term noisy videos.arXiv preprint arXiv:2401.16702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.857069Z"},"links":{"cited_paper":"/paper/2401.16702","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:744f9c27884d3eb1e617efa97dd2b5c1733768738ef18334a60bc9e7ab3b50c5","observation_id":"cabcb29f-76bb-468c-98c7-20dadfc5b32b","resolution":{"observed_at":"2026-08-06T00:18:10.857069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.138068Z","title":"Rethinking diffusion for text-driven human motion generation: Redundant representations, evaluation, and masked autoregression","venue":null,"work_id":"8e90c3e0-0501-484c-9f0b-605e744fc1a0","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.885666Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:f16884992fa624c0aee7e7f27f238b07dc0dc0324b0155e61c03e68b202dea0f","observation_id":"fc20a501-8fd9-45ba-8940-7ee9aff243e5","resolution":{"observed_at":"2026-08-06T00:18:16.238937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.852198Z","title":"Proposal-free temporal action detection via global segmen- tation mask learning","venue":null,"work_id":"0b2bbf0b-3451-4541-abc8-9aec6a72001b","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.925323Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:e961ae5821f37187adcf8eb39ca77897af719c76e3353e52f8a707d3c54b766c","observation_id":"424881ac-e4b6-4324-a00e-6e48c5cc6a0d","resolution":{"observed_at":"2026-08-06T00:18:16.000195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.581998Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis","venue":null,"work_id":"2e6dc4ee-b0c8-4440-8a38-4cff2836b758","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.986515Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:43b9137edf87731e64f09574106bad8e843ad9f48905b14a9dc2a6414dd048a1","observation_id":"ecee7a8d-abd9-4d16-b5e1-d65c7a3ea633","resolution":{"observed_at":"2026-08-06T00:18:15.705738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.306503Z","title":"Now Foun- dations and Trends, 2019","venue":null,"work_id":"c90a1f0f-3850-4b52-b851-d747c46a79b1","year":2019},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.034615Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:42ae71fb6609fc8f7e7e0baf90fd9b3aa5855e778e27a384acbc73efd9a243fe","observation_id":"7fbdb2c5-6e48-471e-97f2-46202e197982","resolution":{"observed_at":"2026-08-06T00:18:15.475588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.083834Z","title":"Mmm: Generative masked motion model","venue":null,"work_id":"f6b166cd-6c75-498f-b66e-ee2db474b944","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.074653Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:38bf5d1113811f6ab0ac4e30675aa9467e1f26181116a5f5baf5ebfd1e416901","observation_id":"9a584c9d-c0dd-48e8-a5ec-be2e508a0d10","resolution":{"observed_at":"2026-08-06T00:18:15.162114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.165073Z","title":"The kit motion-language dataset.Big data, 4(4):236–252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.165073Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:571424d5b1a48f36f000e465a89bc5646f4160169f336758c2bdd1d14bd08ca4","observation_id":"b977c382-ccef-4a8b-8949-22bc2cc3fab5","resolution":{"observed_at":"2026-08-06T00:18:11.165073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.871114Z","title":"Babel: Bodies, action and behavior with english la- bels","venue":null,"work_id":"deaa1eb9-6ca1-48d0-bfe1-bb44de4a8416","year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.246845Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:81157953dc95fc12c9c7ab487883c553ee2e61ba3807ac018e5a4b85c0b9fd16","observation_id":"5d8d8fc0-93e7-4e91-b1d5-9a10e7a9f51a","resolution":{"observed_at":"2026-08-06T00:18:14.986967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.279566Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.279566Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:c3fcad57c9b968d429e87c3dcdaa46015909560b7bfe14f7165135a42d852e39","observation_id":"89c6b694-6741-4344-9dcb-dafa476b1c7c","resolution":{"observed_at":"2026-08-06T00:18:11.279566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.365326Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.365326Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:7260f95d9c95e69c776a98526cc06c85f6e83afd6579a01b53349839ba65af2b","observation_id":"b11f5059-ada5-4929-8cb5-585a11dee210","resolution":{"observed_at":"2026-08-06T00:18:11.365326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.668588Z","title":"Ot-clip: Un- derstanding and generalizing clip via optimal transport","venue":null,"work_id":"b4901988-7f43-40a6-9a62-a0a8c959ce0d","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.436412Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:2a8110104fc0c027f477a2ead38c460bb4f1f4f36aed8b175dfbf1d9a7c2e06a","observation_id":"232ce928-4530-4ff9-bb09-b7e511c4dfed","resolution":{"observed_at":"2026-08-06T00:18:14.742352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-06T00:18:11.477503Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.477503Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:c9fa5e6bee63f57b25619703d115b5807e4765a02dabb1db1605b7b1858c6d74","observation_id":"6b0e7d07-a54a-420e-9339-8cf55db0588d","resolution":{"observed_at":"2026-08-06T00:18:11.477503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.487678Z","title":"Optimal transport on discrete domains","venue":null,"work_id":"cf5c7b19-8326-4490-9968-4dbff076b48e","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.529984Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:7cca1ff052d615124ee2dfb1e3db7e155f538b49e70b5e543589576b2500d2fa","observation_id":"ee65441b-8813-4b88-8777-29ae06394ff9","resolution":{"observed_at":"2026-08-06T00:18:14.580551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07320","last_updated":"2025-01-07T23:10:25Z","snapshot_observed_at":"2026-08-06T20:29:18.862211Z","submitted_at":"2024-12-10T09:08:41Z","title":"CoMA: Compositional Human Motion Generation with Multi-modal Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07320","snapshot_observed_at":"2026-08-06T00:18:11.588885Z","title":"Coma: Compositional human motion generation with multi-modal agents.arXiv preprint arXiv:2412.07320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.588885Z"},"links":{"cited_paper":"/paper/2412.07320","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:6a2ba078ba83c3e8b6c335559a0f71f3577d7825d41dd2cc77b51f915f8909fd","observation_id":"c6481434-0f9e-4afa-9cc2-cdf53114e0fb","resolution":{"observed_at":"2026-08-06T00:18:11.588885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.318738Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"7075f233-bad4-42ea-b232-7321c05a3bb8","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.647315Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:fdb0cdabd8c82d4f6ec5ea35f76cb286d106004c2eecdc3cd804bb4cd4987a40","observation_id":"3ca679e8-3bff-47bc-a24a-7f0a4d873767","resolution":{"observed_at":"2026-08-06T00:18:14.464800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-06T00:18:11.728862Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.728862Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:d7b47313629a7e39f0a2989b83c1d4a3e5532826075a8d370ecb09092fcf7f60","observation_id":"fcaeb8bd-9c66-4074-ae86-5bc2543f89f5","resolution":{"observed_at":"2026-08-06T00:18:11.728862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03311","last_updated":"2025-05-30T12:53:31Z","snapshot_observed_at":"2026-08-06T03:48:31.684275Z","submitted_at":"2024-10-04T10:48:54Z","title":"Scaling Large Motion Models with Million-Level Human Motions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03311","snapshot_observed_at":"2026-08-06T00:18:11.792396Z","title":"Scaling large motion models with million-level human motions.arXiv preprint arXiv:2410.03311, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.792396Z"},"links":{"cited_paper":"/paper/2410.03311","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:d9f215b4f27dd6cdc437b151d9fdfccad6d454b6aff0cf5ed6692f31046fa84f","observation_id":"3f702020-fa09-4a3d-a137-91d7442beead","resolution":{"observed_at":"2026-08-06T00:18:11.792396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.102301Z","title":"Mg-motionllm: A unified framework for motion comprehension and gener- ation across multiple granularities","venue":null,"work_id":"7d6f7376-8a78-4454-8de5-acdc062477b5","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.853616Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:f50e95c2a58875276f8ef5cf3b64b2f03c2c88cbe719b91649cdb4b206748416","observation_id":"f40afea6-d756-4ab6-bf7a-4babacb90ddc","resolution":{"observed_at":"2026-08-06T00:18:14.206099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.951475Z","title":"Dense motion captioning","venue":null,"work_id":"7239e40a-b1f9-4de2-975b-449bd21e7066","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.903996Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:b8abb26f878494be1211482fda12e20083f9725d96ad240c684ecb51c9f61a99","observation_id":"65b39cf5-8667-4a57-afbd-b6db884a8c0c","resolution":{"observed_at":"2026-08-06T00:18:14.014695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T00:18:11.969697Z","title":"Filip: Fine-grained interactive language-image pre-training.arXiv preprint arXiv:2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.969697Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:13148476af2de19bdfd1b52807c0c5473a0586509dba68d516179058177a779f","observation_id":"f8392932-71c2-4c4c-acea-841098fe600c","resolution":{"observed_at":"2026-08-06T00:18:11.969697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.829746Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":"1674281f-6a06-4e7a-aaf1-e619b5462aff","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.034560Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:714e28062ef1cce19f62c47be8c586b04b0e6d5c133470190a6cfb1edfbebd72","observation_id":"c779391c-f27a-4d81-80ab-4fbcf11f13e8","resolution":{"observed_at":"2026-08-06T00:18:13.891286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.118757Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.118757Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:e192f3c75a46551bd4ce95a70e135034f84a39f33db69c9e2158b27bde9b6db3","observation_id":"f3756519-1f9f-4f69-b1dc-2a1634116f49","resolution":{"observed_at":"2026-08-06T00:18:12.118757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.679212Z","title":"Finemogen: Fine-grained spatio- temporal motion generation and editing.Advances in Neural Information Processing Systems, 36:13981–13992, 2023","venue":null,"work_id":"f3c5d3ac-02e3-4a1f-afe5-56fd5c895a31","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.173471Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:b6d7949787e126d90c07bdfa17f728d364bdc577f30f9ac16a448b98f32f0a0e","observation_id":"b402e152-3973-455d-932c-1835a5056a43","resolution":{"observed_at":"2026-08-06T00:18:13.726895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.582798Z","title":"Pre- training clip against data poisoning with optimal transport- based matching and alignment","venue":null,"work_id":"9e0a7374-3e82-4fe4-810a-fd4e11f39beb","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.264675Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:9ac5fd5c1eeca17202267317ab08e67d8244cd03a2e88138f6176472b116d498","observation_id":"8c455f42-98d8-4d38-b96b-1abb68d58607","resolution":{"observed_at":"2026-08-06T00:18:13.640874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.399308Z","title":"DartControl: A diffusion-based autoregressive motion model for real-time text-driven motion control","venue":null,"work_id":"6a28bec1-fe09-4314-8fa8-940105909618","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.328454Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:ad52e56ca5cf1a1b78cebbf934c088898836b005b0cdf553d26a385e36b76fab","observation_id":"0973253c-3618-4620-86b4-6fcc9b32012d","resolution":{"observed_at":"2026-08-06T00:18:13.488133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.279190Z","title":null,"venue":null,"work_id":"1d9e28ff-804b-41b0-be3e-8a21c1d95b99","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.375527Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:233dc4249d1fc99a2a6099b4eee649044b92715fe78579cb1cc304888914b62d","observation_id":"79f73070-d566-43e8-923e-878b1e21a7e2","resolution":{"observed_at":"2026-08-06T00:18:13.339249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.124352Z","title":null,"venue":null,"work_id":"f3a6443b-9487-4690-8112-c0b4a15420d5","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.439527Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:7ab2ae86d1eba233e7caa6e83617a77d3472f2aebd74ad298d5de2a1e940560b","observation_id":"a6f6d641-ed17-44c8-8ab9-3f0f10634fdb","resolution":{"observed_at":"2026-08-06T00:18:13.215087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.997366Z","title":"The annotation process involves man- ual segment-level boundary identification: for each action segmentj, human annotators specify the temporal interval [tstart, tend]in seconds","venue":null,"work_id":"14b06c1b-2187-4a6c-bf2a-79098291ff4b","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.510219Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:3f3705d16818ccb563973ff33cba4dae270cb7276a6f9d4df4d929d65d2a51bf","observation_id":"1845dedb-1e0b-4bd6-b0ef-58b78ec6c43d","resolution":{"observed_at":"2026-08-06T00:18:13.060514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.859717Z","title":"specialized human motion analyst","venue":null,"work_id":"afecc11b-5cb3-409d-9e9a-055603e974a3","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.550250Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:fb2dae17e95134ecf93d201647c3f407f63c0886f1722a4cd8aebaf0f8d6f492","observation_id":"db1aac17-a015-43c4-a123-5f27eda79b80","resolution":{"observed_at":"2026-08-06T00:18:12.924197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.01392."}