{"as_of":"2026-08-11T21:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccb257fb98f47e0a98f95e89fea317be4f71bfe9196f089cffc6cd1a7640ac6c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:32:28.149076Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.14802/citation-record","integrity":"/paper/2505.14802/integrity","json":"/paper/2505.14802/citation-record.json","paper":"/paper/2505.14802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:36.715948Z","title":"Information dropout: Learning optimal representations through noisy computation","venue":null,"work_id":"9cd27c67-59e4-452c-91bb-836496bd2b00","year":2018},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:23.449404Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:8b61395cca32ee33f67209bf1fe83b94f28192c859a7455ea4ec044456b702a9","observation_id":"aacb4c7b-da0d-4ebc-ab65-9a302abd3f9f","resolution":{"observed_at":"2026-08-07T15:32:36.807405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-07T15:32:23.539258Z","title":"Deep variational information bottleneck","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:23.539258Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:db4efbacecbc0745c4f8766777d13dc1c233f4097f11395783bbe17e01f63282","observation_id":"0db71dfa-c6cf-43d4-8a04-d67870adee7f","resolution":{"observed_at":"2026-08-07T15:32:23.539258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:36.564125Z","title":"A comprehensive review on machine learning in healthcare industry: classification, restrictions, opportunities and challenges.Sensors, 23(9):4178, 2023","venue":null,"work_id":"9d10300d-9c26-461c-9ed5-94010aa81c30","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:23.710711Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:30a0511fe61ceeb01e42ea8e9feba2547115d36f4a3e26fe7f7551241964825a","observation_id":"82a662dd-42d9-4442-842a-43f15faa5bec","resolution":{"observed_at":"2026-08-07T15:32:36.652667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:36.427989Z","title":"TSFEL: Time series feature extraction library","venue":null,"work_id":"26c7b212-ffc3-41e1-bea5-860813f575aa","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:23.866001Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:2e736f0ae149ccc9cb72f70b2c69c88e473d29786ab69e27baee7e20cb5f5152","observation_id":"d46e92b6-649d-4188-a975-e4d878738106","resolution":{"observed_at":"2026-08-07T15:32:36.477008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:36.279095Z","title":"TSFEL: Time series feature extraction library","venue":null,"work_id":"578a4c03-acbf-4847-a27b-63a0a6ffbe76","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.004731Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:6197362143c6dc3ffdb22d49390c95e478200386279901d87b5d5e13c86cb505","observation_id":"9c31e9f5-1b95-4219-8a0b-5e84d132c3f8","resolution":{"observed_at":"2026-08-07T15:32:36.345622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:36.129145Z","title":"Financial time series forecasting-a deep learning approach","venue":null,"work_id":"de5a3fad-81f0-440f-8ab3-cf0bd2b8fe9c","year":2017},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.189561Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:bda17456eb1713aff8465270d08474fb872cbf87bd85640e09ff16e2282107af","observation_id":"7919b5eb-7e0b-4760-b50f-5b20f360e9d6","resolution":{"observed_at":"2026-08-07T15:32:36.202852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.977885Z","title":"Information transmission with additional noise","venue":null,"work_id":"ebbe709a-fa5f-4db0-afb2-75b6883f47e4","year":1962},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.317957Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:a24af0eb328398a56f3ca1128b43d38f729937ca04985e8b0f54aa58458f69b8","observation_id":"99796cb8-9e58-4af4-80c6-8cd38cc937e0","resolution":{"observed_at":"2026-08-07T15:32:36.057154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.782585Z","title":"Systematic literature review of preprocessing techniques for imbalanced data","venue":null,"work_id":"5ea9d5e3-9169-49e5-a4bc-b0a77468d37c","year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.468785Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:83e9eeecca9e976bc65b484555591bf25719d98627024a5ee6dc173468c98b39","observation_id":"53513bc2-c581-4707-99be-fc8529756920","resolution":{"observed_at":"2026-08-07T15:32:35.888579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.633204Z","title":"Springenberg, Manuel Blum, and Frank Hutter","venue":null,"work_id":"ad687d88-c1e9-477b-898a-029b4903da6f","year":2015},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.557269Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:774bd32142f66446f0dae1efb81e1fe3ceb3daba57fdfe115843af8477f2a2df","observation_id":"a1b96534-a468-470e-a70c-f8e465856b3d","resolution":{"observed_at":"2026-08-07T15:32:35.693472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.401321Z","title":"Transient classifiers for fink-benchmarks for lsst","venue":null,"work_id":"f54aa127-252c-4045-99bb-caea1058ad65","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.678017Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:c9c93b8893583f07c1d57e047523cbd01fb02534e00feca3d80cbe6cb421a6f3","observation_id":"0d5d15df-7f62-4bd4-b908-6200807d8b80","resolution":{"observed_at":"2026-08-07T15:32:35.469734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.231255Z","title":"The information bottleneck problem and its applications in machine learning","venue":null,"work_id":"bf920dd3-12cb-4f69-9dad-b39d6611516f","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.781800Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:e4b48c266b3b8c3b5c21589bc2fcb42a8347dd697428035a900e73916c272474","observation_id":"35602a54-dd1a-44aa-97b6-8637ca670b5c","resolution":{"observed_at":"2026-08-07T15:32:35.300410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:35.080424Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"3288a83f-3067-4046-add5-d36bb57f77c5","year":2022},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.879276Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:430d727298734b5fea7a373c81022b445f6849e8b0feb4c00e5f10ec30bfa6f5","observation_id":"d3df4971-112a-4dbc-bef2-8bab118fd115","resolution":{"observed_at":"2026-08-07T15:32:35.146788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:24.982583Z","title":"Distributional structure","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:24.982583Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:63ce0bb090cf28f2c9184a1b61d40e6f186b671f9e3c49cd268c0366122c3780","observation_id":"74567220-6d05-4def-934d-ff40b7ed6196","resolution":{"observed_at":"2026-08-07T15:32:24.982583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:25.063577Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.063577Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:db6f509a31df02643d4766585420a856ae56c38250cbf6ecf39d91b1f43b854d","observation_id":"e015a6d3-fc5d-4755-9d79-cea5b93c70c9","resolution":{"observed_at":"2026-08-07T15:32:25.063577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:34.883221Z","title":"A survey of outlier detection methodologies","venue":null,"work_id":"fb2fed8c-9c9d-4c4e-ac33-f410333a6d00","year":2004},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.187335Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:f6ec6603935de7052097850f94e72fc435a29add215df39fad6e20345dea194a","observation_id":"537649ab-9193-40d6-bfdb-60211967b3e4","resolution":{"observed_at":"2026-08-07T15:32:34.975140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:34.721193Z","title":"A framework for extracting urban functional regions based on multiprototype word embeddings using points-of- interest data","venue":null,"work_id":"e06b6193-3e1e-44b3-a915-36e3ea083c42","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.289589Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:e257eb361404b5c62d1bbc5304ccd22f93ba3962370e6a8f4bb5de9d5678f017","observation_id":"32b4ba2e-bd3e-453e-85b4-dc4f03b88284","resolution":{"observed_at":"2026-08-07T15:32:34.791855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:34.498566Z","title":"Multilevel temporal-spectral fusion network for multivariate time series classification","venue":null,"work_id":"d4c7de34-2d3c-47ca-9a69-081934428e69","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.385463Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:9792602512e3d291adb9043e8364572962c6bc66342803e3933e5863f5c04975","observation_id":"55aea251-22de-4aa0-9b17-0f549ed178bc","resolution":{"observed_at":"2026-08-07T15:32:34.629350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:34.309432Z","title":"HRI Dataset","venue":null,"work_id":"3f35ec37-3125-47b3-8ec8-59d8bcb977a8","year":2025},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.487288Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:828b4d6452c2eefa72adea2d343fce46752ee988c89dae2e95b1e842cb2d0bc4","observation_id":"fcaf7703-024d-4943-b2cb-e4c80251f9a3","resolution":{"observed_at":"2026-08-07T15:32:34.395332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08782","last_updated":"2019-09-19T02:50:23Z","snapshot_observed_at":"2026-07-06T08:22:58.185275Z","submitted_at":"2019-09-19T02:50:23Z","title":"Large-scale representation learning from visually grounded untranscribed speech","version":1},"cited_work":{"arxiv_id":"1909.08782","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.08782","snapshot_observed_at":"2026-08-07T15:32:28.498361Z","title":"Large-scale representation learning from visually grounded untranscribed speech","venue":"cs.CV","work_id":"c056850d-b843-4fc5-9712-fb5e415abc9a","year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.641047Z"},"links":{"cited_paper":"/paper/1909.08782","citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:91fd80594dfe73789600e7f02b71ea18eb2ce61b7935bad4344c2307791d60fa","observation_id":"74a333e3-b53f-4b99-bce4-83831901fd62","resolution":{"observed_at":"2026-08-07T15:32:28.628245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:34.166659Z","title":"Autokeras: An automl library for deep learning","venue":null,"work_id":"57a78c6e-4f00-483d-bb8a-0c655f5c5713","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.728739Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:83ceb18b3d240bbd0b684fefe2542618f0000d2943c5af55caf77d97761e6d12","observation_id":"b5a24275-a152-431c-aa3f-977250d189b2","resolution":{"observed_at":"2026-08-07T15:32:34.218015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.996744Z","title":"Dimensionality reduction for fast similarity search in large time series databases","venue":null,"work_id":"adca98f2-2ca8-4eab-98ad-d76141ee59ef","year":2001},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.826625Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:3ef25c34ecb7ce68377eb47784312433a402497e313a016b4cbe50f0531f612a","observation_id":"e4ba270b-4c23-4381-b4ef-e6a5948946d4","resolution":{"observed_at":"2026-08-07T15:32:34.086845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.794301Z","title":"Representation learning of clinical multivariate time series with random filter banks","venue":null,"work_id":"643d0bd2-dc1c-44e8-8969-53c1270acfdd","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:25.917897Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:9cd063a4ba524a0b127b8ad5b35c53ccaa9c2e1309ab79e6ca091f9b12baa88e","observation_id":"4d727bee-f71e-4692-a108-2362698a90a1","resolution":{"observed_at":"2026-08-07T15:32:33.898229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.603288Z","title":"Time series classification of cryptocurrency price trend based on a recurrent lstm neural network","venue":null,"work_id":"6a499db0-2ed6-41e1-9550-f1b7ffaca091","year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.016139Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:5c435bcd7aa61c4f6ec2c839ab89fa204a1e15a8c0d2cbfe68855a2bdfcd3fc3","observation_id":"8ae5e05e-d9dd-4e95-8c1e-e63084497fc7","resolution":{"observed_at":"2026-08-07T15:32:33.669396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.440570Z","title":"H2o automl: Scalable automatic machine learning","venue":null,"work_id":"c6fea72a-85d3-4f44-988a-5546435d9cf6","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.113061Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:13e13c5bcb0ca408e194ede3456c5b9132713679779a7c82447ed0a906f71be5","observation_id":"2a8b3490-f2cf-4f08-8b97-ae7adef50d86","resolution":{"observed_at":"2026-08-07T15:32:33.506535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.293517Z","title":"Detecting outliers: Do not use standard deviation around the mean, use absolute deviation around the median","venue":null,"work_id":"6c6bc719-10a6-4c28-81b2-f85079d71ae7","year":2013},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.201904Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:eea1e28305a16f1c83f1c63d73c43f7f1db8ef99068369008865e5df18ffdfd5","observation_id":"b7ef3520-7abb-420a-9e9e-082143188850","resolution":{"observed_at":"2026-08-07T15:32:33.364053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:33.119571Z","title":"Feature selection: A data perspective","venue":null,"work_id":"d6e43bde-089c-44a4-a495-74b5feea1b4e","year":2017},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.337252Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:9d0b5e9a373ea5373867d70fb66685edf79f25363516db7b1bf4f618818235a2","observation_id":"9dd3406b-5ef4-463a-90fc-31e6daa6b1fa","resolution":{"observed_at":"2026-08-07T15:32:33.187424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:32.966670Z","title":"Missing value imputation: a review and analysis of the literature (2006–2017)","venue":null,"work_id":"0d0ee53a-f26c-4106-a824-2276de0a78db","year":2006},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.427866Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:b1bf8d6f92afac1d64de6b9d5b3dca8da183d8f184377f0cc31fcc135d0e8ab7","observation_id":"69faa19b-20cf-414d-8ec1-f4c7654ec2a4","resolution":{"observed_at":"2026-08-07T15:32:33.032228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:26.493453Z","title":"Cubic spline interpolation","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.493453Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:77a86c8fbcc86f22c8d34a207e2d1e1d7ec67a9d4a2bc9306e2a70272ea459db","observation_id":"274199f1-7afd-4ab2-9f2e-312f1dca847c","resolution":{"observed_at":"2026-08-07T15:32:26.493453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:26.582632Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.582632Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:348e21ad8c703076c076ffd535fd65911fdcc2fe50efff2b36cf3039a1e65926","observation_id":"234353db-c57a-4f8d-b060-2880cddd3775","resolution":{"observed_at":"2026-08-07T15:32:26.582632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:32.755429Z","title":"Enhanced bitcoin price direction forecasting with dqn","venue":null,"work_id":"9f2c138f-7fd2-4ce5-8860-d5f2b8707c8a","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.646460Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:1c26b46ba5a5231a8ef81d1700888f63a259afd58e9bd239b7b1f98aaeda4508","observation_id":"f17e056f-7a01-49fd-8841-216ca5d12eab","resolution":{"observed_at":"2026-08-07T15:32:32.838416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:32.584214Z","title":"Unsupervised embedding of trajectories captures the latent structure of scientific migration","venue":null,"work_id":"7685f704-4238-44cd-a4e1-809eed6f2ba5","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.723782Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:8a7517190f3a15407ab3978afce3a0ea103cb964bb188720bb74df8bdd12014d","observation_id":"91a10310-20c0-4c35-93dc-fc494478a284","resolution":{"observed_at":"2026-08-07T15:32:32.667924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:32.359174Z","title":"Delineating urban functional use from points of interest data with neural network embedding: A case study in greater london","venue":null,"work_id":"ec0c1d49-eaea-4ecf-9433-385db489b145","year":2021},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.789070Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:28356ad843f1758f0cf90c1ee82f57781ce2ba97e6bab68654d645cdf6490282","observation_id":"79a2bb15-2987-46df-8ccd-bae7ff6abbb5","resolution":{"observed_at":"2026-08-07T15:32:32.468483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16511","last_updated":"2025-01-27T21:19:23Z","snapshot_observed_at":"2026-08-10T12:43:32.200400Z","submitted_at":"2025-01-27T21:19:23Z","title":"AMPEL workflows for LSST: Modular and reproducible real-time photometric classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16511","snapshot_observed_at":"2026-08-07T15:32:26.862403Z","title":"Ampel workflows for lsst: Modular and reproducible real-time photometric classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.862403Z"},"links":{"cited_paper":"/paper/2501.16511","citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:5d23274e18108f9beccb5a90ab77a01f4a515bfd5728182a351fee58e4fb7ad0","observation_id":"f3c80c0b-993d-4fef-bdbd-c17149a3508e","resolution":{"observed_at":"2026-08-07T15:32:26.862403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01613","last_updated":"2025-02-03T22:26:56Z","snapshot_observed_at":"2026-08-08T18:16:47.501613Z","submitted_at":"2024-02-02T18:23:18Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01613","snapshot_observed_at":"2026-08-07T15:32:26.935041Z","title":"Nomic embed: Training a reproducible long context text embedder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:26.935041Z"},"links":{"cited_paper":"/paper/2402.01613","citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:8eea85f263de3c0ddaf31b2e34240c0f80d0edf1821b1a1163354f2199d2f05d","observation_id":"9a6514c0-98bc-4723-a6f5-8d050042e49e","resolution":{"observed_at":"2026-08-07T15:32:26.935041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:32.133543Z","title":"Olson, Nathan Bartley, Ryan J","venue":null,"work_id":"0b19832d-feeb-4f65-aabf-18fe7095c75b","year":2016},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.015106Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:948c078f58a75211478e80a92a9481d9050f46d570c0202c6f8c3120bbacee8a","observation_id":"58cd422e-7336-411a-b495-99db0578e862","resolution":{"observed_at":"2026-08-07T15:32:32.241264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:31.916461Z","title":"text-embedding-3-small","venue":null,"work_id":"91a0cac0-5c8b-4a3d-a05c-1e0aa8002132","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.082813Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:0c0020a4ebbc02f56c6b5c9d7f6c4ff215812139a054ced667044a23da93fc94","observation_id":"57a58a61-9cc0-452b-9e71-8f433005e410","resolution":{"observed_at":"2026-08-07T15:32:32.011822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:31.719523Z","title":"Tsem: Temporally-weighted spatiotemporal explainable neural network for multivariate time series","venue":null,"work_id":"5c29f919-cd8a-4f09-a987-1422b0a788b6","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.155965Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:be84b063489c3f0113c3c71abd65fab4bced41ca2237dc1088428002407a6658","observation_id":"14063025-a6b5-4085-8cb5-cd15a329cc9c","resolution":{"observed_at":"2026-08-07T15:32:31.833307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:31.498998Z","title":"Convolutional neural net- work fault classification based on time-series analysis for benchmark wind turbine machine","venue":null,"work_id":"9e6e70e6-38e9-4e5e-8d5a-667654ca7101","year":2022},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.211284Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:6cfb176a5558f47da923d8a8407e90213d7cfb275127838bb2eee259e92cf2bf","observation_id":"5130f959-d010-4531-b5c2-06bfa5a7eea7","resolution":{"observed_at":"2026-08-07T15:32:31.607659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:31.279696Z","title":"Modelling data pipelines","venue":null,"work_id":"8d426a0e-148a-4fd9-96cd-21681febeb2f","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.301404Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:e851e7e492b212fd460717192f83343d3469335f31a6c70358d3275e1fd91dda","observation_id":"e7767995-9404-492c-97e4-ed32ab3fb562","resolution":{"observed_at":"2026-08-07T15:32:31.380298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:31.051569Z","title":"Time-series cryptocurrency forecasting using ensemble deep learning","venue":null,"work_id":"e342b477-156b-4298-a80f-ef28fa00a259","year":2023},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.359698Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:4739541d378fc9c5ee5109e1f02bbe281b052804f354e0a39399c0fe08e8685f","observation_id":"eac3e038-1e51-469b-a062-9793f709cf5a","resolution":{"observed_at":"2026-08-07T15:32:31.162771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:30.846643Z","title":"Word embeddings for the analysis of ideological placement in parliamentary corpora","venue":null,"work_id":"2ceebe3e-4cd2-410b-b2df-e958b1d582df","year":2020},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.449438Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:c0d35fe11b60f870570ab1b0732e24172262db86b4f742fb633549b561938889","observation_id":"26e8ab9b-723e-40e8-93fd-12214060f545","resolution":{"observed_at":"2026-08-07T15:32:30.939335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:30.628138Z","title":"Predicting high-level human judgment across diverse behavioral domains","venue":null,"work_id":"e6561d25-4768-4d81-967e-b2e66e596419","year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.524459Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:a584d31d577d148ae12cc91d01929a5fe13324859cca580548c3613eb59dffad","observation_id":"636bf2ca-0d3d-4da7-8323-ff72aa8064f6","resolution":{"observed_at":"2026-08-07T15:32:30.731072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:30.437063Z","title":"Gaussian processes for time-series modelling","venue":null,"work_id":"3ada7563-5676-475e-80b9-7aad555fc526","year":1984},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.622073Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:fa2c9347b4e85190174cfa774d286ca8783a488cfdf8b1cf51f44071378407ff","observation_id":"3a869dbe-e1fb-47f6-838e-da9d499c0fa4","resolution":{"observed_at":"2026-08-07T15:32:30.530030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:30.268913Z","title":"Automl: A systematic review on automated machine learning with neural architecture search","venue":null,"work_id":"c9be8073-cb9c-4401-94cb-c4b4f63dbe6e","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.687851Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:00cd2f4457affdf9957091a14bdb7344f352437589554b75d03efaad8b7d2210","observation_id":"2d8fa0ee-c750-47b3-8d9e-108080e269e3","resolution":{"observed_at":"2026-08-07T15:32:30.354364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01496","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:28.331673Z","title":"Oracle: A real-time, hierarchical, deep-learning photometric classifier for the lsst","venue":null,"work_id":"69e34b5a-9956-4aa5-bbca-b2b318d8a52e","year":2025},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.749167Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:19e1028344d89e9b58e4c8c44ab18b706b8e8ef3ffa6365d7dd18db3810e08c8","observation_id":"d61ff29d-b2a8-42cb-984c-03e04ee80249","resolution":{"observed_at":"2026-08-07T15:32:28.392498Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:30.106290Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"2581267d-a4ac-446e-9e91-b98ba1c9ddc9","year":2019},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.818031Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:e3597a08de4099efa54975f8d5ac6e0843227011923e4ef52527b41cd0b976a4","observation_id":"f8a37a06-51db-4f6a-a6cf-abd039445ee5","resolution":{"observed_at":"2026-08-07T15:32:30.177369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:29.988006Z","title":"Survey: Time-series data preprocessing: A survey and an empirical analysis","venue":null,"work_id":"c0815fff-083c-42be-a6ae-a4ef2272529d","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.857161Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:06a6ac2b5e758990413c6b870cb9ba7f3f2156e60999526bde947eb3d32969ba","observation_id":"43c3f354-6c5d-4559-b82b-29e0e2122e1d","resolution":{"observed_at":"2026-08-07T15:32:30.063099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:29.787870Z","title":"up”) or decrease (“down","venue":null,"work_id":"fed6227d-9307-4696-92ef-185dc3bd40a8","year":2024},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.931923Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:9b7273998439f372125a9da663d0ab5b502db0d535e1b7489cdf065b341a3b5b","observation_id":"70f829bb-3685-4cc0-9a07-16db26455803","resolution":{"observed_at":"2026-08-07T15:32:29.956990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:29.459584Z","title":null,"venue":null,"work_id":"9f14350b-3e7b-45c3-a917-9112499c11c7","year":null},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.935295Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:5d6b99ab5b65fa18ac4c5aaddd6a511d084a5e5a8fa48a93a37a29da326b1419","observation_id":"131fc23c-644f-4ddd-8fa9-9aab34c140f5","resolution":{"observed_at":"2026-08-07T15:32:29.614622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:29.105849Z","title":null,"venue":null,"work_id":"2510af37-e82c-48c1-ae63-6060d828640a","year":null},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:27.977320Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:3f5cd4c1a6ece4d24358dcd5d493fa63593227fd61c82ec7cd0c7a8025386bab","observation_id":"e8adf54c-4ab2-4f36-b868-aa586f9d2076","resolution":{"observed_at":"2026-08-07T15:32:29.261692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:28.890942Z","title":"negativity","venue":null,"work_id":"d9675b09-fa3e-4afd-92eb-33b98f4d6ee0","year":2018},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:28.059564Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:047e004d5f49ae817254234032e42dbf2628e86ac9096199b009bc8bbe65a5ad","observation_id":"66ad6b61-c460-4154-9c06-c49657b3639d","resolution":{"observed_at":"2026-08-07T15:32:29.001501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:32:28.750654Z","title":"Table 5: Per-class performance on the HRI dataset","venue":null,"work_id":"f3ab8835-6067-4207-bd83-73115d3d3242","year":null},"citing_paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers","version":1},"reference_index":7009,"source":"pdf_text","source_observed_at":"2026-08-07T15:32:28.149076Z"},"links":{"citing_paper":"/paper/2505.14802"},"observation_digest":"sha256:bfad29e07cd70e75e94038be60fc38b4eb6b987ce1a68712856ec373d31053fb","observation_id":"98b2f3bd-e6f6-4819-ab83-55862510bc57","resolution":{"observed_at":"2026-08-07T15:32:28.792953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14802","last_updated":"2025-05-20T18:12:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T20:18:07.794790Z","submitted_at":"2025-05-20T18:12:19Z","title":"Text embedding models can be great data engineers"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2505.14802."}