{"as_of":"2026-08-16T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb29a61c78e35d09e520bd43a563e4963fa5c01ffe5006c1194d33a7108e76eb","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:15:57.272572Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.03477/citation-record","integrity":"/paper/1908.03477/integrity","json":"/paper/1908.03477/citation-record.json","paper":"/paper/1908.03477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.203287Z","title":null,"venue":null,"work_id":"a0b782e5-87eb-4eb9-af37-2a11d83d1532","year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.015401Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:a71146dfccb5627e48b3eb32d29bfaba4ea954e39c0053d499dc7f6acfa2e921","observation_id":"09347ffc-8b47-4a24-89f0-7dcf42b6192e","resolution":{"observed_at":"2026-08-14T14:15:58.209242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.05339","last_updated":"2018-01-16T16:29:11Z","snapshot_observed_at":"2026-08-14T19:54:40.035359Z","submitted_at":"2018-01-16T16:29:11Z","title":"Re-ID done right: towards good practices for person re-identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.05339","snapshot_observed_at":"2026-08-14T14:15:57.023091Z","title":"Re-id done right: towards good practices for person re- identiﬁcation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.023091Z"},"links":{"cited_paper":"/paper/1801.05339","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:77045c83c0bd9e568e7c276782963da5b193c4b50e43a9cf87c61491d24a0c4e","observation_id":"70e071cc-fe06-4f05-8010-266a3834f327","resolution":{"observed_at":"2026-08-14T14:15:57.023091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.177873Z","title":"NetVLAD: CNN architecture for weakly supervised place recognition","venue":null,"work_id":"238fe1d8-9c4c-4528-994f-ecfd43dd81e3","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.029900Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:c38eb644dc45c472d6fded8d38ec89a1e010b753d26e72e067b4b501fc06001f","observation_id":"a7526b53-9e57-488c-8b35-236a261a4bca","resolution":{"observed_at":"2026-08-14T14:15:58.187494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.153459Z","title":"An empirical study and analysis of generalized zero- shot learning for object recognition in the wild","venue":null,"work_id":"55de81cc-1224-412b-bb67-25dbbff5201e","year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.036174Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:6a8563c373db16a392ca569bef5c41129a105aa98260b413c95c28ed757e6cea","observation_id":"eb52af3d-3229-4db1-b3f3-9c81d452bc61","resolution":{"observed_at":"2026-08-14T14:15:58.160419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.132836Z","title":"Beyond triplet loss: a deep quadruplet network for person re-identiﬁcation","venue":null,"work_id":"48be990d-a02f-40f1-8f00-c910b730b0f7","year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.043008Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:468f7faee6e1e0133f7aa6f92296ad5b3c6022f96f52ec862d42ee12852be0e1","observation_id":"40f1f8b8-8e51-435a-8b4e-ce75457b613a","resolution":{"observed_at":"2026-08-14T14:15:58.139875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.114934Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"06970f55-a133-4fb3-b471-d272a86fc319","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.055743Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:f34c945376af5eb8b5140cfc0484b226f4beb1b375a6ebd65c49c4ad382b7930","observation_id":"0b862c3b-5658-46a5-81f0-01806def26c8","resolution":{"observed_at":"2026-08-14T14:15:58.120942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.097658Z","title":"Predict- ing visual features from text for image and video caption re- trieval","venue":null,"work_id":"52d0a941-5b55-4da9-82b7-8d6660ad55e1","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.061105Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:d79b704c5746e356c72bfae5494890898ad9ba4910adf32ebbddfc23f9970e64","observation_id":"c4095747-5b8f-4326-9d83-56a92a40de35","resolution":{"observed_at":"2026-08-14T14:15:58.103558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.06181","last_updated":"2019-03-19T14:32:13Z","snapshot_observed_at":"2026-08-14T18:27:29.310716Z","submitted_at":"2018-09-17T13:13:14Z","title":"Dual Encoding for Zero-Example Video Retrieval","version":3},"cited_work":{"arxiv_id":"1809.06181","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.06181","snapshot_observed_at":"2026-08-14T14:15:57.466507Z","title":"Dual Encoding for Zero-Example Video Retrieval","venue":"cs.CV","work_id":"aa6f5f63-5020-4aae-a1f9-d915c7030767","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.065902Z"},"links":{"cited_paper":"/paper/1809.06181","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:5af71e17c74e520bf2ee352519baf35f83d75c3cba36a8cf27d8d88a0a855fa8","observation_id":"86de2abf-eb5e-4198-8626-0b4c4a2c1b66","resolution":{"observed_at":"2026-08-14T14:15:57.473760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.079170Z","title":"Improving image-sentence embeddings using large weakly annotated photo collections","venue":null,"work_id":"fe023c82-819c-4579-aff7-2a886962b57d","year":2014},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.071958Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:0c01e3eedd221ab2a80cd2b6697fce2c7cf5463888d4a395e3200e47f9f8db20","observation_id":"91628ae4-1ca5-4ff3-a5a9-f518899f9046","resolution":{"observed_at":"2026-08-14T14:15:58.086177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.059897Z","title":"Deep image retrieval: Learning global representations for image search","venue":null,"work_id":"8048f74d-6766-4c86-a11f-85a491c342a8","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.077021Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:ef0aa0ba24e2b64713f2c9fbd408f543facc68025f879582f6f1e6df18c16729","observation_id":"24c39c6a-2d93-41d4-ab83-5847f64df17e","resolution":{"observed_at":"2026-08-14T14:15:58.065837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.040709Z","title":"Beyond instance-level im- age retrieval: Leveraging captions to learn a global visual representation for semantic retrieval","venue":null,"work_id":"0c12d555-c1f1-4342-9788-c8e5eae3a7aa","year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.082890Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:c9958467f6137f59c2eebea193a6ffa477fb92e1be85a45db1ff1c3cef2dcf09","observation_id":"437a4b4c-65a0-4334-91a8-3b7703c905ea","resolution":{"observed_at":"2026-08-14T14:15:58.046935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.022658Z","title":"Something Something","venue":null,"work_id":"11f2f3bb-212d-4b75-9362-153f30d3cff1","year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.088103Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:583104437052cf2a6c375e3148eb670d98d917f8daee5b206ce067e0ab08f08d","observation_id":"8356357a-0ab1-4ed0-a846-89dbbf0fb2a7","resolution":{"observed_at":"2026-08-14T14:15:58.028366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:58.001922Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"6d2ac2a2-8666-42ba-8d4d-247e3d75e181","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.093921Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:49e34d6ea1b9818d4e7bc0f7729d60dce681cca3fa265e2037b1d03f09f21253","observation_id":"48d26ae9-a8df-4a56-a7a8-807789c60ed5","resolution":{"observed_at":"2026-08-14T14:15:58.009196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.978112Z","title":"Youtube2text: Recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition","venue":null,"work_id":"a4a03898-e869-4c36-8a4a-d20204072782","year":2013},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.099943Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:e7c3d0629c87b29d2f81c95a8c14aeefe039111a1df8fde155ea4124561d1620","observation_id":"ce2de66e-540f-4bbb-87b6-0d4b12c9a203","resolution":{"observed_at":"2026-08-14T14:15:57.985015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.960051Z","title":null,"venue":null,"work_id":"7f2f81f6-5f4b-46ce-8db6-50a2757f4b84","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.106075Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:29160201121058b9f7ac1de47f48e4eca4847943f2e7ab76fc41429f955dffd3","observation_id":"b1399349-65c3-4448-af8d-9686b1960d0c","resolution":{"observed_at":"2026-08-14T14:15:57.966058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-14T21:10:31.788257Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-14T14:15:57.111220Z","title":"In de- fense of the triplet loss for person re-identiﬁcation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.111220Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:79b99b7556ce5a5f3eea0547d4f85fb6118727ad2ae31c4e634739770c2e0899","observation_id":"47c7d464-2874-4da8-b38a-bda26323ec06","resolution":{"observed_at":"2026-08-14T14:15:57.111220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.939833Z","title":"Deep metric learning using triplet network","venue":null,"work_id":"96461ad2-f287-4067-be3b-d69356eb6b2b","year":2015},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.116903Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:a642770e9d8c1bd13364511cd835043eb3d5cff90e26284511e3ac2cb63646e4","observation_id":"cce0550f-0af1-45af-bb9b-8b78364b9faa","resolution":{"observed_at":"2026-08-14T14:15:57.945593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.920803Z","title":"Unifying visual-semantic embeddings with multimodal neu- ral language models","venue":null,"work_id":"8a3580cd-0557-4bb9-a0dc-ace7fe81e141","year":2015},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.122863Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:9ecff00e38ecaae093c371d973ad761212f659f72751733f397a00bee1563d53","observation_id":"46f38826-3731-4783-a1ae-56bcc6ed91d4","resolution":{"observed_at":"2026-08-14T14:15:57.927132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.903183Z","title":"Learning two-branch neural networks for image-text match- ing tasks","venue":null,"work_id":"e4372129-f3a0-4f62-a6b2-1110efaccb0f","year":2019},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.127947Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:84861c5975766af937800d48957b0e805c86b5453aa809ca2cce468c8c0e1d85","observation_id":"6d57a355-c19c-4736-9c72-0db32e089aa0","resolution":{"observed_at":"2026-08-14T14:15:57.908471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09235","last_updated":"2018-11-29T03:59:19Z","snapshot_observed_at":"2026-08-15T01:28:13.631631Z","submitted_at":"2018-04-24T20:06:55Z","title":"On the effectiveness of task granularity for transfer learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09235","snapshot_observed_at":"2026-08-14T14:15:57.133392Z","title":"On the effec- tiveness of task granularity for transfer learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.133392Z"},"links":{"cited_paper":"/paper/1804.09235","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:00627d920bf39c9a47be98b5c7e5e21c2065c971c61d7ccead908582ef91e673","observation_id":"165f5939-6426-4545-b699-ce487380717f","resolution":{"observed_at":"2026-08-14T14:15:57.133392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06905","last_updated":"2018-03-05T12:30:37Z","snapshot_observed_at":"2026-08-14T20:52:34.108757Z","submitted_at":"2017-06-21T13:49:14Z","title":"Learnable pooling with Context Gating for video classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06905","snapshot_observed_at":"2026-08-14T14:15:57.139487Z","title":"Learnable pooling with context gating for video classiﬁcation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.139487Z"},"links":{"cited_paper":"/paper/1706.06905","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:aa90f20069e8b906dca57d1e4ad8aa0cf7340f6a0e775300275efb900d75587c","observation_id":"611c895f-318a-438d-82f6-b8eef42c219e","resolution":{"observed_at":"2026-08-14T14:15:57.139487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02516","last_updated":"2020-01-16T13:18:58Z","snapshot_observed_at":"2026-08-14T19:28:20.540278Z","submitted_at":"2018-04-07T06:59:45Z","title":"Learning a Text-Video Embedding from Incomplete and Heterogeneous Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02516","snapshot_observed_at":"2026-08-14T14:15:57.144801Z","title":"Learning a text-video embedding from incomplete and heterogeneous data","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.144801Z"},"links":{"cited_paper":"/paper/1804.02516","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:5c3c0703d18734d86b1dcac4c4720e7961505faa1727b27c464c71163b021035","observation_id":"ad39cbdd-ded8-4ef3-a79b-62d059664eaf","resolution":{"observed_at":"2026-08-14T14:15:57.144801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.150310Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.150310Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:76622851e15abcffa77441c564ab72976e9aab0742265fddf7823130d7f4a2db","observation_id":"aac8fecd-fc60-415d-9bb5-d576ca70a05c","resolution":{"observed_at":"2026-08-14T14:15:57.150310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.871750Z","title":"Learning joint embedding with multimodal cues for cross-modal video-text retrieval","venue":null,"work_id":"b18e1654-8aa6-47f1-bd67-00393b268852","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.157125Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:784ebb131e5733e5d00073191d1d2b60eb3b3b92967308ed0dc363932d22fcfc","observation_id":"8e5e29eb-be5f-4f25-9112-4a3b710ce7a2","resolution":{"observed_at":"2026-08-14T14:15:57.878011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.852145Z","title":"Learning joint representations of videos and sentences with web image search","venue":null,"work_id":"5fec71bc-fe95-40d6-81b2-6e72065ac359","year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.162683Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:afbed51bc20e7ce50050bf6595b156a3a06bb5f8cf3bfb8289868ec0b9365965","observation_id":"bcaa3663-4b73-45ec-8b97-3e3a89210ea3","resolution":{"observed_at":"2026-08-14T14:15:57.859538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.833868Z","title":"Enhancing video summarization via vision-language embed- ding","venue":null,"work_id":"5570e042-0689-4216-8471-06358a09ceb0","year":2017},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.168392Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:c0a421a76c70e742abc0892b9afb27b0e60e3199479ede7eb3518c6366384e05","observation_id":"23fb74cc-65c8-4b6a-88d3-d2106a05bdee","resolution":{"observed_at":"2026-08-14T14:15:57.839909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.812147Z","title":"CNN image retrieval learns from BoW: Unsupervised ﬁne-tuning with hard examples","venue":null,"work_id":"24a5f9e6-08e6-42c6-bcaa-ac299a9904e5","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.174858Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:0714eecf5367c610b8b8afca78ae210fafa4407278eb59f8a6ec0038f42011b1","observation_id":"9e4c1524-2906-440f-998e-d771ed3b57aa","resolution":{"observed_at":"2026-08-14T14:15:57.818744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.790783Z","title":"Recognizing ﬁne-grained and composite ac- tivities using hand-centric features and script data","venue":null,"work_id":"dd99290d-fabc-4f2d-ab2d-1f56a503adc1","year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.181674Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:d9298e7acd6f22f1bf7e9b80d209d2f337811e8157cca3a4585de907810095a8","observation_id":"2aa1b1a3-a3bd-4aa1-b917-fb7cae7cb855","resolution":{"observed_at":"2026-08-14T14:15:57.797187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.766368Z","title":"Facenet: A uniﬁed embedding for face recognition and clus- tering","venue":null,"work_id":"9aa7f818-36c9-48bd-bfe7-2cbc7829b81d","year":2015},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.190379Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:a13ec30dbd717c448ec0ef66849b7bd20909bea2d1fa8534c0e7181b4f1ef49b","observation_id":"b72f6f25-cffc-4b26-8a4f-4af865fa33aa","resolution":{"observed_at":"2026-08-14T14:15:57.773385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07519","last_updated":"2019-11-19T02:13:11Z","snapshot_observed_at":"2026-08-14T17:57:00.246510Z","submitted_at":"2018-11-19T06:22:50Z","title":"Higher-order Network for Action Recognition","version":4},"cited_work":{"arxiv_id":"1811.07519","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.07519","snapshot_observed_at":"2026-08-14T14:15:57.339715Z","title":"Higher-order Network for Action Recognition","venue":"cs.CV","work_id":"99df141e-563a-4438-9a6b-067f4b1d602c","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.195289Z"},"links":{"cited_paper":"/paper/1811.07519","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:3393e80f47051d58965eb5455fb6e371e8c1dcf5f1ec0504488c4246f737b914","observation_id":"9967b099-b0d6-4ea4-8209-3ee0cbe3c6e2","resolution":{"observed_at":"2026-08-14T14:15:57.347997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.739152Z","title":"Sigurdsson, G ¨ul Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":"5d0708cd-02dc-46db-be90-c34c2fca33ab","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.201647Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:b81290f34a1922ec4c80064fddd0e69e610a84b9b16ce04a3280e86374abf186","observation_id":"a2eab173-ae32-4ee7-b040-75ac41588ab3","resolution":{"observed_at":"2026-08-14T14:15:57.745079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.720066Z","title":"Improved deep metric learning with multi- class n-pair loss objective","venue":null,"work_id":"725f7832-9ef1-41ac-9eb5-1034da219b64","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.207509Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:0bf6be0cf99151b128ccd4464ecec65325b20e02190fbaaec47a5f7a18bfbf6c","observation_id":"888645c1-88be-4105-b163-bea0dd21e166","resolution":{"observed_at":"2026-08-14T14:15:57.726059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.698089Z","title":"Cross modal embeddings for video and audio retrieval","venue":null,"work_id":"c24d27c9-96e0-4097-a991-294982fd9a98","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.213105Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:ebc20c5bf9d7168f8024fe7486b20be0942f6862792365bdf2ddf5a6e3f93ee0","observation_id":"ffd6b78b-0223-4de0-8d70-c4c8d8e10659","resolution":{"observed_at":"2026-08-14T14:15:57.705322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08124","last_updated":"2016-09-26T19:14:12Z","snapshot_observed_at":"2026-08-14T21:38:06.655633Z","submitted_at":"2016-09-26T19:14:12Z","title":"Learning Language-Visual Embedding for Movie Understanding with Natural-Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08124","snapshot_observed_at":"2026-08-14T14:15:57.218372Z","title":"Learning language-visual embedding for movie understanding with natural-language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.218372Z"},"links":{"cited_paper":"/paper/1609.08124","citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:b69108ca4bfbde242bba2ef13b6a29bb7eb0f79d0f042745b0ef06137363f378","observation_id":"8555b7f9-6dfc-4b21-8d2a-0122fb6050c0","resolution":{"observed_at":"2026-08-14T14:15:57.218372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.668872Z","title":"Learn- ing ﬁne-grained image similarity with deep ranking","venue":null,"work_id":"08833ae0-7281-425b-916e-7b7437912534","year":2014},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.224034Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:a7e214efed335e19cc316ac1450ea270b6c63f07fbf3c61bb58e155390f3e3f1","observation_id":"df1b3d13-f745-42f3-b12f-0d53586ee99e","resolution":{"observed_at":"2026-08-14T14:15:57.683785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.647118Z","title":"Learning deep structure-preserving image-text embeddings","venue":null,"work_id":"187fa0b3-c209-4b4c-9754-be36a85fee1c","year":null},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.230640Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:6228d2892eb8a567dfe7800d65c51e4676eebc13288ab8bfa3cfe7aa4b706d77","observation_id":"939fc6d5-a252-4f04-9e2f-fbf3a1fbdf57","resolution":{"observed_at":"2026-08-14T14:15:57.653864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.627695Z","title":"Temporal segment networks: Towards good practices for deep action recogni- tion","venue":null,"work_id":"558958ff-d213-4e18-83d5-fd7102f98c4a","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.237032Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:b9a2088bb7c1712c38eb2015c4260c27da202aaa97251ac88df7c122cefdf34b","observation_id":"ebca65a9-0e2d-4061-8e1c-0fc8167dc29a","resolution":{"observed_at":"2026-08-14T14:15:57.634381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.604930Z","title":"Learning visual actions using multiple verb-only labels","venue":null,"work_id":"6bdbc5d4-4a58-4610-98b6-fbddea1ec4e9","year":2019},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.243318Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:e203a643ec1462418fc2c99e8152141653fdd9b10ad874bbf2e177c512864c0f","observation_id":"1bb59219-bbbf-433e-aa3d-aacdf9ac1e7b","resolution":{"observed_at":"2026-08-14T14:15:57.611464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.582859Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"88cb9d79-c6c1-4565-b1a4-6a41b3d5daaf","year":2016},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.249711Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:64c4378f6cb4b5e5e2d8f91df3a831044dfc6f156a8f61d951d7ea85310a82f6","observation_id":"e00a62a1-00b5-42b8-8970-f9002b97fd6a","resolution":{"observed_at":"2026-08-14T14:15:57.591146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.548481Z","title":"Jointly modeling deep video and compositional text to bridge vision and language in a uniﬁed framework","venue":null,"work_id":"77b54080-0077-49a3-85c8-dbce091f95e7","year":2015},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.255506Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:a6629949ac3de71492567c28263fd1b0cfa5a0ceceac4267c852e9416e0c3c2a","observation_id":"51108899-bda2-4313-823d-5bb99511e90c","resolution":{"observed_at":"2026-08-14T14:15:57.556663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.527970Z","title":"A joint se- quence fusion model for video question answering and re- trieval","venue":null,"work_id":"3430be62-a884-48d2-9f16-c6bd670337d7","year":2018},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.262176Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:84fb87f31d7eea39e3a9100a358ef77294657f3501fd832a25e8dfb04d1c68bb","observation_id":"ecc408dc-a83e-4a8f-8726-c74941c7f6b9","resolution":{"observed_at":"2026-08-14T14:15:57.533791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:15:57.510200Z","title":"Zero-shot learning via semantic similarity embedding","venue":null,"work_id":"8b70d46c-6abe-47ab-9a63-2945bd583565","year":2015},"citing_paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:15:57.272572Z"},"links":{"citing_paper":"/paper/1908.03477"},"observation_digest":"sha256:fbfefac853faba38fc75d8a2e9323c39c3934a5f9533624967aa13eee4563d90","observation_id":"78072827-6038-4ace-9a0b-2f39734e026c","resolution":{"observed_at":"2026-08-14T14:15:57.515796Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03477","last_updated":"2019-08-09T14:41:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:22:11.752994Z","submitted_at":"2019-08-09T14:41:06Z","title":"Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":30},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:1908.03477."}