{"as_of":"2026-08-07T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7461548d7b7d3aee840ea5b87d2466f9ea7308dcaded7e5710cf3782438971db","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:07:20.190660Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23188/citation-record","integrity":"/paper/2507.23188/integrity","json":"/paper/2507.23188/citation-record.json","paper":"/paper/2507.23188"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.064139Z","title":"Dual stream relation learning network for image-text retrieval,","venue":null,"work_id":"e48a0388-bb2a-438e-b20c-98295d41c3b3","year":2025},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.917710Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:47ace4542ff50ba8e83504e58606e4ddb85835ed37e4eb31dac6b30ed94fb4f0","observation_id":"c3d0d4c0-abe6-40c1-825e-40047a55204f","resolution":{"observed_at":"2026-08-06T11:07:21.068747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.048528Z","title":"One-shot human motion transfer via occlusion-robust flow prediction and neural texturing,","venue":null,"work_id":"198eaf62-39ad-442f-a2fe-cd1f77242c12","year":2025},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.922972Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:d2594f94cea00f5a424360bf2bf7009bb5c8c522e504f8aed9e155c069266df2","observation_id":"6d2d2a13-d0a9-4b2e-b8d1-c2da8f8b414c","resolution":{"observed_at":"2026-08-06T11:07:21.053234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.033175Z","title":"Ta2v: Text-audio guided video generation,","venue":null,"work_id":"96319e8c-3e14-4e28-a7d6-4867c17a447c","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.927797Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:f87d188ec964b785233e827be7779aa6d9bed3060bc2d07f275e57c73c72e8ae","observation_id":"7ceb4654-f82d-4be2-9590-087d0ae274dc","resolution":{"observed_at":"2026-08-06T11:07:21.037886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.017945Z","title":"Cross-modal quantization for co-speech gesture generation,","venue":null,"work_id":"83746d8d-1bf7-47b5-86cf-d3fb53b4b10e","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.932734Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8859b233b66605353acbd79f803a3e8b0ec1aed5fbe77fea20f3ae80a32cae1f","observation_id":"ac0208f8-bb09-4692-a9a2-d32d9ba81178","resolution":{"observed_at":"2026-08-06T11:07:21.022470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.003098Z","title":"Generative adversarial graph convolutional networks for human action synthesis,","venue":null,"work_id":"38e33300-b292-445d-8669-35fc82676abd","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.937380Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:7f1613342fdd940f3356767a589090638a182fa3ee088c4d703e4e6d6d900608","observation_id":"d7739b76-5e27-4f66-bc15-a47e715def06","resolution":{"observed_at":"2026-08-06T11:07:21.007627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.988501Z","title":"Action-conditioned 3d human motion synthesis with transformer vae,","venue":null,"work_id":"f29172cf-7180-4633-9e32-a749a709239b","year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.942055Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:7060f85d15681958693268e4a07acbace10f75407979b4f2476dcdee0b0736a3","observation_id":"522a19a5-af03-4a68-9383-3fd6bc0db884","resolution":{"observed_at":"2026-08-06T11:07:20.992982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.973345Z","title":"Multiact: Long-term 3d human motion generation from multiple action labels,","venue":null,"work_id":"f33217de-88da-466c-9ef9-046731b31780","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.947230Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a46e1f9818e2616e0029e7cdc1ae0436a104904339b48bbe10404c6a0f32a223","observation_id":"a865e48a-ab43-4969-8c7d-b0be2125ced4","resolution":{"observed_at":"2026-08-06T11:07:20.977904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.958449Z","title":"Executing your commands via motion diffusion in latent space,","venue":null,"work_id":"31f096a2-e150-4435-87ef-e05154219b4c","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.951851Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:91dfb7f17b216a754d86f9e0493fd6b0fe2f9f5ce3f6bd3cc0c451ed06521330","observation_id":"49b08ef6-91b7-48c6-ad88-c94983e8c4f1","resolution":{"observed_at":"2026-08-06T11:07:20.963097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.943221Z","title":"The kit motion-language dataset,","venue":null,"work_id":"8ca0c840-67f0-4084-929c-681d7dff3e9c","year":2016},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.956741Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:d2aeebcb2fa24eff6f378a7e6284d3a537c119ad40abbe86957cd7164e430955","observation_id":"01d81e7a-032c-4844-8915-e6e7ae299068","resolution":{"observed_at":"2026-08-06T11:07:20.947896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.928281Z","title":"Generating diverse and natural 3d human motions from text,","venue":null,"work_id":"0f7668ea-d265-40a1-945c-cc1fddc72f4c","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.961155Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:12b76b39d92b2bbd3899539923d09236794ec3429859e63d72d18d997f4fa02d","observation_id":"095dfe23-4e48-47f8-9e90-2b6f8acdda8e","resolution":{"observed_at":"2026-08-06T11:07:20.932758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.913717Z","title":"Human motion diffusion model,","venue":null,"work_id":"69c39c66-7a24-46f2-92d2-65f9f2ab6a6e","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.965631Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:4cdae6c9cadf454cf1217ba73d8a57059bb6c64d5b01c4377d7474d4d9171f47","observation_id":"227eaee2-97e9-449c-a7c2-4ab8269e7e2f","resolution":{"observed_at":"2026-08-06T11:07:20.918269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.897988Z","title":"Generating human motion from textual descriptions with discrete representations,","venue":null,"work_id":"b8e2f771-a232-45f9-9576-ba4af75191d2","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.970336Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:943a8179fbc47f75df8ad5778b72586192f0a1d833aa2be0c4783068f611aeca","observation_id":"e0e44298-732d-4cc5-b0ba-bed362a7e0a1","resolution":{"observed_at":"2026-08-06T11:07:20.902943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.882733Z","title":"Groupdancer: Music to multi-people dance synthesis with style collaboration,","venue":null,"work_id":"07dd0bc5-3f09-4b5d-b623-dbd27a8601a5","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.974905Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:633253e2a8fc590c74a7dcc383ef9bb9d8b72e33df0f44d6ae6c85f400ec8c83","observation_id":"36c58672-c52c-481e-a62c-dc7cb2ad78ac","resolution":{"observed_at":"2026-08-06T11:07:20.887444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.867571Z","title":"Music- driven group choreography,","venue":null,"work_id":"2928cf3c-c4d1-4bfe-a9a2-5bcefa92b806","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.979443Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:c4c63713a844b2b38b92723055faf7e17ed5e2327087c1fe7710a338ee20a3bf","observation_id":"743646df-9965-40b7-9484-63b14329913c","resolution":{"observed_at":"2026-08-06T11:07:20.872221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.851907Z","title":"Edge: Editable dance generation from music,","venue":null,"work_id":"e8ef5fca-656a-4614-8edb-0822c9375a62","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.984111Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0dddd07869ff28cbffa4d71bfd7891931c18825aa4a09b129b9c374b73e042ae","observation_id":"c150045f-27fa-4875-a74a-f66c9598bc86","resolution":{"observed_at":"2026-08-06T11:07:20.856766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.836777Z","title":"Pc-dance: Posture- controllable music-driven dance synthesis,","venue":null,"work_id":"d9d756f6-5f05-4181-85e5-4eea1707fb89","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.988790Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:420d6db5b9b99be3e95ce760be56ac0c14c4865b4a1c48c4e82152f624d2952c","observation_id":"d56ec5b9-7cc4-4c18-b93d-4e9ab369e531","resolution":{"observed_at":"2026-08-06T11:07:20.841247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.820400Z","title":"Couch: Towards controllable human-chair interactions,","venue":null,"work_id":"841e56c7-dffe-4480-a618-77f4ec2d5af1","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.993269Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:3864afab20b82b298640cb9d51881cb9ee7908475bafe3ea496bfaa074725cc0","observation_id":"0abead2e-3c61-4f25-aff1-009e29565489","resolution":{"observed_at":"2026-08-06T11:07:20.825215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.805054Z","title":"Goal: Generating 4d whole-body motion for hand-object grasping,","venue":null,"work_id":"ef17972b-ecb9-48c1-b829-19da516e10fd","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.997850Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8ab7a1a3380a765dc910086e2774d917ab019376092adfe92b52e4fca2c115f1","observation_id":"a509508f-d436-49c5-983f-9de104d75d41","resolution":{"observed_at":"2026-08-06T11:07:20.809687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.790702Z","title":"Human motion generation: A survey,","venue":null,"work_id":"ec03ea3e-7b8d-4798-903a-502b23e3e957","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.003279Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a9d5f931310bce146e652f38ce20887476dc396be853a596d140a835eccf15c0","observation_id":"86592244-b176-4903-be80-4943ac117cde","resolution":{"observed_at":"2026-08-06T11:07:20.795219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.775947Z","title":"Phase-functioned neural networks for character control,","venue":null,"work_id":"72ba2f3a-8f9f-4614-a405-3dfe4c69d57d","year":2017},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.009756Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:e8de29c8ae8e7253a27810e233d651b47357cc6d517c1a8f18585db1465a81ba","observation_id":"6e0bc659-6b8e-48e9-878f-c6b549566402","resolution":{"observed_at":"2026-08-06T11:07:20.780450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.760635Z","title":"Learned motion matching,","venue":null,"work_id":"435dcfb4-b080-4dfa-8a50-a1a7c9d68273","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.014500Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:06673a733e7e4d0f34020552f7b5f492c1f60d14001e37f839a15b4eb25e4fec","observation_id":"0b5a84df-0c83-4c98-bc86-5774b7ba02bb","resolution":{"observed_at":"2026-08-06T11:07:20.765128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.745942Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis,","venue":null,"work_id":"5d341c73-e1f7-4092-9f25-083431f6a93f","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.023014Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:6ccbee2fa791275f033599d93d158593189b4bc52f2d6e2b751ae6c717f2efab","observation_id":"d0429251-a731-407a-bc5d-e9b12eb55dce","resolution":{"observed_at":"2026-08-06T11:07:20.750358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.729609Z","title":"Tri-modal motion retrieval by learning a joint embedding space,","venue":null,"work_id":"0c3cd754-4c21-4df4-b66c-741a53d14103","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.028116Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:35b7cd36fe647944bd76d810e13cdc249867d5493397c6b8645c99d55575a2e7","observation_id":"46e64a69-2467-4b76-8040-8d643eca10fd","resolution":{"observed_at":"2026-08-06T11:07:20.734968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T11:07:20.032813Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.032813Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:27fe7a67c9f70783acd52c279515242e0603a081b17e8ba473d0177241cef265","observation_id":"af304b00-2e5b-41c4-a3b6-7ff024a44696","resolution":{"observed_at":"2026-08-06T11:07:20.032813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.711540Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":"44539034-6091-424d-a6f4-47646a490681","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.039109Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:27b45e70664c4571fae7cf6a92e1b16e2922cd845152366fe9ff930446f4bc9a","observation_id":"cbaf0f20-03b5-457b-ac6b-7415c8d21989","resolution":{"observed_at":"2026-08-06T11:07:20.716915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:07:20.044506Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.044506Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:1de2c8a11bf00299d2f63603bc46a4f0344b390f82ed815832fea768dcee9b66","observation_id":"980f1468-0f6e-48d7-bd95-59f812a4ea20","resolution":{"observed_at":"2026-08-06T11:07:20.044506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.695116Z","title":"Motionclip: Exposing human motion generation to clip space,","venue":null,"work_id":"91f08dc5-edbd-47b6-99cf-579b6bcd3747","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.051712Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:e0a75c8aeb76ef388fd96e80b6cdcb63f913a9b0222a742cff4a9791e7096750","observation_id":"0e4cc8ae-f314-40d2-8d38-0f7fa9a0b957","resolution":{"observed_at":"2026-08-06T11:07:20.699757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.679890Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":"c8b010e3-f80b-4692-91a9-6af0693b4e20","year":2014},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.059703Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:944e61373de8382c41836245d1aaaf5dbab9bc73a71c92eab3fb712d2464c5f5","observation_id":"5d148ccc-0ace-447d-a638-ecab485f4080","resolution":{"observed_at":"2026-08-06T11:07:20.684212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.665298Z","title":"Temos: Generating diverse human motions from textual descriptions,","venue":null,"work_id":"d60364cd-9b61-43a6-bc8b-b00fd9d8536f","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.064485Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:375215ddcd75b5710af44a8e58d453f71e635ff4f94988573f22e6b2aa152836","observation_id":"9f74b422-15a8-4075-b93f-212138c3eea6","resolution":{"observed_at":"2026-08-06T11:07:20.669620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.650605Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal generation of 3d human motions and texts,","venue":null,"work_id":"ab5654d1-03bb-43d7-800a-c364644c1be8","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.069062Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ffb88fd6bb414aab28b3db38e54875ee63bf4c171a3c1a000d8b9290cfbad732","observation_id":"a1d28c1c-9ff6-4dae-8c36-96221fdfd196","resolution":{"observed_at":"2026-08-06T11:07:20.655016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.635571Z","title":"Neural discrete representation learning,","venue":null,"work_id":"ad7390bc-9ada-412b-9405-433f07dc1b1b","year":2017},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.073904Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8669dda733a98b5d84ee1fb1feb31de7ea5bcd56bf8e1aa98b4a7b1f6b53c156","observation_id":"cc001b1f-5078-4bf3-8b27-61411de93679","resolution":{"observed_at":"2026-08-06T11:07:20.639950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.079034Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.079034Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:694ec345783dea7cfaf0eccbbd83982d446a2ced41b5c9d7678681d39d1f03c4","observation_id":"7d1a1a47-e705-484a-aa53-034314937976","resolution":{"observed_at":"2026-08-06T11:07:20.079034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.610456Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"0351a7c0-c956-44aa-b241-962259cba2ad","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.084405Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:6babf4c63857b485fc23552261af8a23f945ff8cd918c775cec3510dd46de6ac","observation_id":"6f22fbf2-7921-43ad-98df-5f01da09ceb6","resolution":{"observed_at":"2026-08-06T11:07:20.615160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.595672Z","title":"Global meets local: Dual activation hashing network for large-scale fine-grained image retrieval,","venue":null,"work_id":"c56342ad-9a2b-4e9a-9d85-1ffe13e559f3","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.089655Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:20d492cb74ea7ac002946933d10fb6ef617644490a105a008a2eb1bf18fae5b9","observation_id":"801e400f-3c78-4cc2-8d11-48671b98f329","resolution":{"observed_at":"2026-08-06T11:07:20.600313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.581385Z","title":"Dvf: Advancing robust and accurate fine-grained image retrieval with retrieval guidelines,","venue":null,"work_id":"8558cba9-0b2f-45ed-be4d-3d821be652ff","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.094537Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:039cfd7407fd6888efb86196815dd8c9807815418154fad95cbf291d5c8c2e5f","observation_id":"085ce84c-cda7-4bf3-a71f-3ed7e673b97b","resolution":{"observed_at":"2026-08-06T11:07:20.585697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.565527Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"7ba6f9dc-0661-4b0f-b74e-ec30f978db8c","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.099676Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:057e1ce9ec5915ce275f9020a529852b78b0d3dd32d24b9c63f5370f32c1bd97","observation_id":"3ecb2ba1-991b-4672-ae3d-88e04a36b54b","resolution":{"observed_at":"2026-08-06T11:07:20.570573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.549742Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":"d4ea25c9-ccee-47ee-899d-63e5d910b76c","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.103973Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:93969831b6d4f1cfa4ed9e5283bb5bf024c1336096125621b64603296959fc8c","observation_id":"6d3d0b5d-d03c-4756-a1dc-c42c77076b7a","resolution":{"observed_at":"2026-08-06T11:07:20.554167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.534903Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"fc0b7e15-987b-4c93-967c-e24b2f6dc0d8","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.108193Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:eb92deff2a37b75e23385af23b713a9515842060fc07621b09e73dd538e8f0d3","observation_id":"982ee88c-1a82-46ff-b814-f8c92ab31047","resolution":{"observed_at":"2026-08-06T11:07:20.539447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T11:07:20.113044Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.113044Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:4efdc0d208e51f56e9f74b49a7b8d9dfdc8a5dc4d587fa349a842099bf9324c9","observation_id":"c0871aeb-5f63-4cab-af47-1f51f2579950","resolution":{"observed_at":"2026-08-06T11:07:20.113044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.519162Z","title":"Audiolm: a language modeling approach to audio generation,","venue":null,"work_id":"bad02df0-6dbe-43ca-a9c5-efb6293d57ba","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.117704Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:591988475c5298ec65c3e3506a76ccf3f30e85ba72e666696eca93160b3523bb","observation_id":"b59dbc53-86c7-4293-8276-ac490fdaf30c","resolution":{"observed_at":"2026-08-06T11:07:20.524041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.504546Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"02d525ad-8cae-40de-be16-cdcf5c2f33b9","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.122266Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8b2adfd81524db43219501350fcbe0945a66216460202020d94f0be728fed4ad","observation_id":"4f80dfef-9939-46f6-9a24-a32d0ec6e2e1","resolution":{"observed_at":"2026-08-06T11:07:20.508969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T11:07:20.126818Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.126818Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:c74ba9a571859d6c5c08ea8dceb121ed2d83c76df34565b5676389db8cec7ea9","observation_id":"4660fb3d-fdf7-40e6-89ae-fe74d8854c43","resolution":{"observed_at":"2026-08-06T11:07:20.126818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.489064Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"24a7acf2-ddda-42ab-89bd-0c1b57c059ff","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.131594Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:08be8eb9268e15e293e6eb45d2ecfe1468330e8810ee5335c4f481a46bff0997","observation_id":"dc30a259-434d-4211-a537-8b4b5270b804","resolution":{"observed_at":"2026-08-06T11:07:20.494265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.136841Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.136841Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ca24ea219eeb9ce365681e74fdcf973dbad8481442e174fb27728b53313735a9","observation_id":"d449bd73-c834-4a0d-80f1-de423635cec1","resolution":{"observed_at":"2026-08-06T11:07:20.136841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.463846Z","title":"Videopoet: A large language model for zero-shot video generation,","venue":null,"work_id":"05fabcff-cc80-452f-999f-191e3145ccd0","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.141428Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:d7b433b4f636927c1ec31c87a9f9736bba70c95df6c0957a48b64ccb899c66c1","observation_id":"ae742115-187d-4977-aa0a-de9c99ed3517","resolution":{"observed_at":"2026-08-06T11:07:20.468393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.448567Z","title":"Label independent memory for semi-supervised few-shot video classification,","venue":null,"work_id":"03a9734f-0997-45ea-b70f-24104fcbbb03","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.146030Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:969ba5ce4b85d7c5b0c44a2d63de3c7c7dcd6801556f3814f51d7757b710d09b","observation_id":"1b317a51-829d-4de2-b82a-963fb5ab2e10","resolution":{"observed_at":"2026-08-06T11:07:20.453186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.434064Z","title":"Memory-enhanced transformer for representation learning on temporal heterogeneous graphs,","venue":null,"work_id":"c69c58da-9ede-4dbe-8ae2-e94d139cb888","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.150446Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:b8829753f9cf39f22a01c54349c072d8d5c183d4001f4b548e122548064f262f","observation_id":"801c818e-be16-4958-8cb8-7cc96a45afc4","resolution":{"observed_at":"2026-08-06T11:07:20.438474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.419833Z","title":"An efficient memory module for graph few-shot class-incremental learning,","venue":null,"work_id":"737dedf9-2696-4b0e-a7b2-0738c6e7b4a4","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.155284Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a56706b11ae1477e88288f0143d155f6e1ba950410519ec72400e0b96da2713d","observation_id":"392e1a5d-4b2b-4ed8-b666-15d909101a2c","resolution":{"observed_at":"2026-08-06T11:07:20.424127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.403758Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"2a51d0ff-a74d-4a84-98f9-468974f0288d","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.159521Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:c6e88c522337a25ca598f26ce117d7048af161ee603b0ab2a35e2a8dfc0102fe","observation_id":"5b0982a6-d2e9-414b-bb65-99388e515b22","resolution":{"observed_at":"2026-08-06T11:07:20.408819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.387889Z","title":"Grounded language-image pre- training,","venue":null,"work_id":"d9c53368-0451-4fe7-ad60-db963da4c79c","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.163885Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5f2f9a934715eea6752b5be820cfce9bf5eeb5e586e817f177c4961007b0debb","observation_id":"a4b8a03c-d931-481a-88e3-c217fb40e66d","resolution":{"observed_at":"2026-08-06T11:07:20.392196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T11:07:20.168158Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.168158Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0ddc3155cf4c88b226cb3eb3f8d47c208fa21a3cf3afed8f2c72dc2a35876d94","observation_id":"0e899e0e-25bf-4e3e-ab1b-d6b312477551","resolution":{"observed_at":"2026-08-06T11:07:20.168158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.372825Z","title":"Delving into multimodal prompting for fine-grained visual classifica- tion,","venue":null,"work_id":"3603466d-e27b-4b7d-bcb5-f36dfff3f2d1","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.173210Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:c5f7714f9ac8d8ae55d4e54d90d6c4a79e002f4ebfaa80f1ccfe4e66985c78d6","observation_id":"026a9884-f216-416a-b701-5d015e57fc77","resolution":{"observed_at":"2026-08-06T11:07:20.377514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.357434Z","title":"Amass: Archive of motion capture as surface shapes,","venue":null,"work_id":"1bd044f0-d630-474c-a460-85eb919be7e2","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.177499Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:94555bca8f4f7bf07889273bc38e03c3c7f5749a54c70b9a6ddefe017abe90a0","observation_id":"426b2e26-f8d3-4a76-b4a3-3f56eee89156","resolution":{"observed_at":"2026-08-06T11:07:20.361998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.342536Z","title":"Action2motion: Conditioned generation of 3d human motions,","venue":null,"work_id":"fdb71d56-023d-4f42-929b-093dd7ec34f6","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.181731Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5e22568e5040996e7b60179da99eb7b9f296d12fab79432eb8b5ad0828bf87b7","observation_id":"7ef95020-8e13-4f9c-9011-b7434957e4bd","resolution":{"observed_at":"2026-08-06T11:07:20.347117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T11:07:20.186032Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.186032Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0a707706e21a7009ef07b544c873cc3cd2f47a71687842b40e6fb95ed346c724","observation_id":"0f038371-bae1-4e37-9541-80b9b3c4ff3d","resolution":{"observed_at":"2026-08-06T11:07:20.186032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.325187Z","title":"Randaugment: Practical automated data augmentation with a reduced search space,","venue":null,"work_id":"4f4074ef-6121-4db1-9772-ae1ac8696a3c","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.190660Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:73c345d63c1d0ad6761dfd800035dbd12e9328c58bf65ac80ae3f6868d0ef336","observation_id":"b1a739eb-9df3-4685-bf1f-f5100fa96c4b","resolution":{"observed_at":"2026-08-06T11:07:20.331762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2507.23188."}