{"as_of":"2026-08-14T08:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2948ffe6a438d8fefd006c2d8064028e0d81ae662358bdca3b18001ff3d7036d","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:29:56.617980Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10020/citation-record","integrity":"/paper/2607.10020/integrity","json":"/paper/2607.10020/citation-record.json","paper":"/paper/2607.10020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:45.764850Z","title":"Why keep hospital clinical records?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:45.764850Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:275d88341659b3ccf2db030846523bf6edb5e479e0afc71c90e469917fccc72d","observation_id":"f0d54603-bae2-4ac4-a4f2-f914bea4729b","resolution":{"observed_at":"2026-08-02T07:29:45.764850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.004752Z","title":"We hacked a robot vacuum -- and could watch live through its camera","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.004752Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c67133381ef59e3b518934b86045a5cc8742fdbd8e239e7d688130d6f4828344","observation_id":"760fd118-226d-4c0b-8ad5-1979c6857bfd","resolution":{"observed_at":"2026-08-02T07:29:46.004752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.125248Z","title":"Robot roaming some federal office buildings raises privacy concerns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.125248Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:7d01d3b5439c0326868ddc4674ee5b6e4b50d6fe40fccd90502a040152a59529","observation_id":"74baf9c9-0557-43fe-8b0e-7f9f615afb8b","resolution":{"observed_at":"2026-08-02T07:29:46.125248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.229855Z","title":"N kan KI-generert tekst vannmerkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.229855Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3c6b061fbe4ad4e1f43301d3dcce29c99a78f547eb0cea6eb364a301e8dede05","observation_id":"4c4261a4-1465-4993-bba6-1447345c3103","resolution":{"observed_at":"2026-08-02T07:29:46.229855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.335582Z","title":"Kan kunstig intelligens forst spr k?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.335582Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:94610105da8cd8e61a1e3565a4d9c4e26b0e4e0508110ecef48a964a6925b92b","observation_id":"2497bc79-2f79-4904-ae4e-759f51b388f3","resolution":{"observed_at":"2026-08-02T07:29:46.335582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.424923Z","title":"Privacy and confidentiality issues in historical health sciences collections 2012 law & informatics issue","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.424923Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:94a179fe888ad75c7274d7b142cd9d3c3f508645f5a0c86de59deb9cc25b7f04","observation_id":"04dd53ab-7f6e-484d-ad3f-2caee19896da","resolution":{"observed_at":"2026-08-02T07:29:46.424923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.540320Z","title":"Unsupervised Text Deidentification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.540320Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f5aeb0860f9a1b5ba491335785e35e5d13c52259b743d4c351566a703976a19b","observation_id":"8db4b614-e4ee-41b7-b7a4-b3823faa611b","resolution":{"observed_at":"2026-08-02T07:29:46.540320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.644815Z","title":"skweak: Weak Supervision Made Easy for NLP","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.644815Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:46f3cf7d49e02964a02dae99884c2dfe02bbf12a7137d80df2b1945659a4c729","observation_id":"45bbf452-a756-4be6-83f5-9ffba4578937","resolution":{"observed_at":"2026-08-02T07:29:46.644815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.731186Z","title":"Replication in visual diffusion models: A survey and outlook","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.731186Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3c4ccc3f26449c1a64ac8dee8a3f5cd813da2dc7f1f1dbc5e81bb8bd65a5fda3","observation_id":"23c22eb4-2f29-4389-afa9-965d46808059","resolution":{"observed_at":"2026-08-02T07:29:46.731186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.798600Z","title":"AIStorySimilarity: Quantifying story similarity using narrative for search, IP infringement, and guided creativity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.798600Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2b1f9a9f0a3bb0b412c5b45f3df58fca27b1519a0424e262e6a3e9651faa6d76","observation_id":"a57d92e4-465b-49c0-91f8-d30ba4dddf53","resolution":{"observed_at":"2026-08-02T07:29:46.798600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:46.927088Z","title":"CopyBench: Measuring literal and non-literal reproduction of copyright-protected text in language model generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:46.927088Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a7d2e5eee9d406c142d4e776a5da88e04826ebf0be397968e92ed6a09b22c4cc","observation_id":"ad0178c7-b489-43b8-9a34-604c5ec493ab","resolution":{"observed_at":"2026-08-02T07:29:46.927088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.064745Z","title":"Alignment for Honesty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.064745Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3c9363966c773957835e16745df7ad54559425cb0e5e884f655e3570b7f2714c","observation_id":"da5ac0d6-478c-4538-a520-b134932399e1","resolution":{"observed_at":"2026-08-02T07:29:47.064745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.134746Z","title":"Scaling up membership inference: When and how attacks succeed on large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.134746Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6421830844f6922a83c706f91b1aa0979a0dac869d671a63ad950adb14f42637","observation_id":"e6dfb41e-78ec-48fb-87da-1f7ba95e9a2c","resolution":{"observed_at":"2026-08-02T07:29:47.134746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.203619Z","title":"Do Membership Inference Attacks Work on Large Language Models?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.203619Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f2dbc54a6a9ff5cf25631afd92e1afbfceea1171cff633e7c340fa971d71f0be","observation_id":"4a4523b1-6cdb-4395-9ec7-e1cb7122e7a7","resolution":{"observed_at":"2026-08-02T07:29:47.203619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.282419Z","title":"Membership inference attacks cannot prove that a model was trained on your data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.282419Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:8e5bb7a91a6e89ff301a1367cc1c18672661197226e905e43bc55c83ca013dc7","observation_id":"9bb12338-1e1d-49a1-8a1f-ad011c9ed293","resolution":{"observed_at":"2026-08-02T07:29:47.282419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.364749Z","title":"Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.364749Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3860e5af8c75250ddc398cad08b737ec5638cd4683e3d0ff7a0b23f1b9167b58","observation_id":"22d1d0f0-e8ee-47d5-9efe-93cb56786ccb","resolution":{"observed_at":"2026-08-02T07:29:47.364749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.448293Z","title":"Noisy Neighbors: Efficient membership inference attacks against LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.448293Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:22c6267f06d37c0fb0d12a8dca6fb7742f5343e8d7a5bbdff3f1e5693d05568d","observation_id":"04586e23-6be1-4223-a31c-51f85f7b95eb","resolution":{"observed_at":"2026-08-02T07:29:47.448293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.555870Z","title":"DF-MIA: A distribution-free membership Inference Attack on fine-tuned Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.555870Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:85a7494e520fbb992a85377ff31067a15d6ae009c47f1459e288b19bc8ddb0fd","observation_id":"80024a5d-7bc5-4741-9a10-b89a7338045a","resolution":{"observed_at":"2026-08-02T07:29:47.555870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02902","last_updated":"2024-11-05T08:35:08Z","snapshot_observed_at":"2026-08-12T22:07:30.692965Z","submitted_at":"2024-11-05T08:35:08Z","title":"Membership Inference Attacks against Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02902","snapshot_observed_at":"2026-08-02T07:29:47.644741Z","title":"Membership inference attacks against large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.644741Z"},"links":{"cited_paper":"/paper/2411.02902","citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6f9335616b06484b39702d71618df2b32588aa270c11b5cd42b72f9a74a00551","observation_id":"2c156047-daa3-4a6f-96ab-b86472c98bee","resolution":{"observed_at":"2026-08-02T07:29:47.644741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.723402Z","title":"Not all tokens are equal: Membership inference attacks against fine-tuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.723402Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9b7170da9f7606c4d72718f61ae33fb4c9b49a106b37b7e423f78fe9c3dc8619","observation_id":"4cced56b-cfcf-4c2c-b357-95b620418b9f","resolution":{"observed_at":"2026-08-02T07:29:47.723402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.781899Z","title":"Data Attribution for Text-to-Image Models by Unlearning Synthesized Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.781899Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:5cf21b93378d4ebaaae9346ea353b49666f0da276f366e52b63593a1a817ecc8","observation_id":"38c55117-b042-4fd4-b97f-19e1215fd4ba","resolution":{"observed_at":"2026-08-02T07:29:47.781899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.888952Z","title":"Source-Aware Training Enables Knowledge Attribution in Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.888952Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:ce702621fd3e94fb3ef071de1d90fa6de09b7448b237de0d39a991338aa41654","observation_id":"c92bcf2f-71df-4345-aa9f-647cf664a188","resolution":{"observed_at":"2026-08-02T07:29:47.888952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:47.959496Z","title":"Large language models for automated open-domain scientific hypotheses discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:47.959496Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:03bd7212d32793a593858fea7250de99306231879ec14ab579e5226c3a3b1d7b","observation_id":"0cb0bec9-dd8e-4803-85b9-a0159ad22aa6","resolution":{"observed_at":"2026-08-02T07:29:47.959496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.043984Z","title":"HoneyBee: Progressive instruction finetuning of large language models for materials science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.043984Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a2074e89fc4535f8b38bbd919d171afef520141af2e36e981f443c0f0aa5002a","observation_id":"26ec1e14-bf82-44f7-9df1-62c9c54af48a","resolution":{"observed_at":"2026-08-02T07:29:48.043984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.135502Z","title":"A large-scale audit of dataset licensing and attribution in AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.135502Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6c1657d95a77730719cb512c53c6897842260e2f0187fda27a9b8ae87e9055e2","observation_id":"f258c0d5-b67e-4b97-adfd-ea64aba1fb8a","resolution":{"observed_at":"2026-08-02T07:29:48.135502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.281890Z","title":"Inherently privacy-preserving vision for trustworthy autonomous systems: Needs and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.281890Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:67ab88d5c42a77a76695a90e27093d7be994d7a5ff2c41dd9579411b8857f195","observation_id":"47234fbd-ae49-45cc-baaf-ebb30f06bfa7","resolution":{"observed_at":"2026-08-02T07:29:48.281890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.418101Z","title":"Unsupervised utility evaluation of text anonymization methods via neural language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.418101Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:fd3e41d74ce485fac35e16de897071f025ef92a8decdc425b5f3a681c9f62b01","observation_id":"89a416d1-62ed-4bd8-b4e8-58f312b0a598","resolution":{"observed_at":"2026-08-02T07:29:48.418101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.501824Z","title":"Thermal imaging in robotics as a privacy-enhancing or privacy-invasive measure? Misconceptions of privacy when using thermal cameras in robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.501824Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:646f2ae792af664604a4fed46d112290a41cf1e8fd6adf5429ec5cbca4b38504","observation_id":"7ec01a1b-3deb-4ca0-9f8f-30f419684436","resolution":{"observed_at":"2026-08-02T07:29:48.501824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.619573Z","title":"Privacy-preserving robot vision with anonymized faces by extreme low resolution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.619573Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:d1e86a17afae2e4b04a14b64a163a57eaec7a9e4fc7c22b24ee51f29e3908fc3","observation_id":"87695ced-3bc0-4752-b014-836ec80b58bc","resolution":{"observed_at":"2026-08-02T07:29:48.619573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.702555Z","title":"MicPro: Microphone-based voice privacy protection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.702555Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2eaf448719848f53e1b32068ac1e06d0f90f85ba83db7d8534517b4106a7361a","observation_id":"22fe98c6-e55b-4073-aaa8-28a891944be5","resolution":{"observed_at":"2026-08-02T07:29:48.702555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:48.917765Z","title":"Investigating privacy in the context of office delivery robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:48.917765Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:fcb7d0d04775e32eea9f1e91162c7e7c5d0fcd6c35a76571a1d5a539de0a4cb5","observation_id":"ba72106d-478b-4674-a76b-12bc3bfd67ab","resolution":{"observed_at":"2026-08-02T07:29:48.917765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.091378Z","title":"Robots as AI Double Agents: Privacy in Motion Planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.091378Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:605c4f1d22bf2fbd749f635c393a84d9033f3219d5818301c22587e438fd0110","observation_id":"9475e226-7db9-4e19-ba5e-8fdf4a0a4c79","resolution":{"observed_at":"2026-08-02T07:29:49.091378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.217001Z","title":"Themes and research directions in privacy-sensitive robotics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.217001Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:881afbaf76be80b8fe0dcb7f51fa658cc7bac471fb69874002672b9d529aa5b0","observation_id":"e41b3bb5-35d5-4775-9aaf-e0e262e20a07","resolution":{"observed_at":"2026-08-02T07:29:49.217001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.283071Z","title":"Privacy beyond data: Assessment and mitigation of privacy risks in robotic technology for elderly care","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.283071Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a4ce87629736e751299bf831bf9fbeaceb268667f2446be3d86b77ac998de4f7","observation_id":"43a9c8e8-6dc4-4bf7-882c-3aec884c71c4","resolution":{"observed_at":"2026-08-02T07:29:49.283071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.445722Z","title":"Understanding users' perception of privacy in human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.445722Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:add029d30ce019201fa595352b74b2819113c91d8d30dd61c7b8d18c4f7af5c9","observation_id":"1a50e04c-4a23-4e9d-9161-a0af3322546f","resolution":{"observed_at":"2026-08-02T07:29:49.445722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.585102Z","title":"Privacy considerations for socially assistive robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.585102Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:08622d66d2eb33389eef145f1a3d90807a06f84017ba64a9fb701bbbc8035883","observation_id":"a7298af8-6676-428b-8c8f-dc3fe87ce344","resolution":{"observed_at":"2026-08-02T07:29:49.585102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.736939Z","title":"Surveying adult perceptions of privacy and attitudes towards social robots in the home","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.736939Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:f165cdc2202ca2e15d6765d37925b5e17d415a8db53ca59dd690a8ad51a4a355","observation_id":"7f1f176f-1065-4f98-a798-667c5618fca5","resolution":{"observed_at":"2026-08-02T07:29:49.736939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.856879Z","title":"Remix: Making art commerce thrive hybrid economy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.856879Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e1d122657a46d9a7019eee10cbd826ba3ba48b873338535a2e5061f45ef83a43","observation_id":"01ad6569-2ba7-409c-8f0c-1ec495a0e67c","resolution":{"observed_at":"2026-08-02T07:29:49.856879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:49.899471Z","title":"Conceptions Code: How metaphors explain legal challenges digital times","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:49.899471Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:bf6aeff37835aed4dda67c1fc1e2c9b391591703234afb84a8d2ec9396a7d1ec","observation_id":"0959cf53-e9e2-4f51-bf2a-e5cc624eedf1","resolution":{"observed_at":"2026-08-02T07:29:49.899471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.049611Z","title":"DE-COP: Detecting Copyrighted Content in Language Models Training Data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.049611Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:5bc4b035d53d8affd4244638045d3e96cc8a256eaeaa9a251a9a5c9d6acf3f1f","observation_id":"5049569d-5478-4379-b52e-a35e1b9773b9","resolution":{"observed_at":"2026-08-02T07:29:50.049611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.221970Z","title":"HoneyComb: A Flexible LLM-Based Agent System for Materials Science","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.221970Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:756d71a0288132cfbb3a1cee516432e3b974b0ccb10a5a02f6157f79f77727ca","observation_id":"fbfb04fd-24b1-48eb-bcf3-9905f03dfbd4","resolution":{"observed_at":"2026-08-02T07:29:50.221970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.303864Z","title":"Materials science in the era of large language models: a perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.303864Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:859c33342813e9fe286a58e341f1eb783508cfa6c15014ee471296d14558a6a2","observation_id":"b53ea92f-a1c6-4225-b2d1-378e950a2bb8","resolution":{"observed_at":"2026-08-02T07:29:50.303864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.422257Z","title":"MatPilot: an LLM-enabled AI Materials Scientist under the Framework of Human-Machine Collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.422257Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:539e67a5408693be9946ba35c13570e3ba131933b819e93e051fef9f19a10800","observation_id":"6821b893-1ee8-4172-b45c-4fbfa8cc526e","resolution":{"observed_at":"2026-08-02T07:29:50.422257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.614745Z","title":"MaScQA: investigating materials science knowledge of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.614745Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:df5597542c3461cec22ab4a391984b406a9ad7467fbbbb93e867d8905f7ad13c","observation_id":"1ef80f66-a3d6-4316-b6a1-6c5d56989c2a","resolution":{"observed_at":"2026-08-02T07:29:50.614745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.712252Z","title":"Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM Agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.712252Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:d6abc11e3fa61d6ef814b14a6b3d9aa9259a42226476c565bfddf826d9ba57b9","observation_id":"3cb5b008-b2eb-4259-9a34-8ec3d86011e7","resolution":{"observed_at":"2026-08-02T07:29:50.712252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.763996Z","title":"Crystal structure generation with autoregressive large language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.763996Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6ce2b49614b6fd6f3170ab01064105eb7104dd3df8fb3b92bc045c16a7527367","observation_id":"4c97966f-3c71-49b7-8967-205ede4f96f3","resolution":{"observed_at":"2026-08-02T07:29:50.763996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.840252Z","title":"Leveraging large language models for predictive chemistry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.840252Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9944659c890cd19311bb947467555e6fcb43fbec44e215f2b8043e8aed225894","observation_id":"b49d04a3-c0c8-427c-96ff-fadfb342b3f6","resolution":{"observed_at":"2026-08-02T07:29:50.840252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:50.954747Z","title":"From text to insight: large language models for materials science data extraction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:50.954747Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:22ee9ca208ae0d6dd5a3f019404108b47dee611d2c14641fe38c0f03056adac2","observation_id":"60bb8533-23dc-47a5-9fd1-dc1bfe864cda","resolution":{"observed_at":"2026-08-02T07:29:50.954747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.028719Z","title":"LLMatDesign: Autonomous Materials Discovery with Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.028719Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:60c2f9ab9ed13b2fbff5737d55168d121a9910d06380faab65c8023ce10a1fbd","observation_id":"fa805cbc-7550-4197-9c7f-dfa0bc41f150","resolution":{"observed_at":"2026-08-02T07:29:51.028719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.181184Z","title":"MatText: Do Language Models Need More than Text & Scale for Materials Modeling?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.181184Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:83acf78914102b700f3154b9d01163a62b8ac7b925c4bf8520862e7597805718","observation_id":"020673ba-ab89-425b-9776-c1e22468a2d4","resolution":{"observed_at":"2026-08-02T07:29:51.181184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.291502Z","title":"MechGPT, a Language-Based Strategy for Mechanics and Materials Modeling That Connects Knowledge Across Scales, Disciplines, and Modalities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.291502Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3d418765e60612d35b5cb1b2d8ec21e2afbd870750bcb49e7ce4d8eb6335f1e4","observation_id":"13c577ed-2e34-496b-b1d7-705ab53762f7","resolution":{"observed_at":"2026-08-02T07:29:51.291502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.429152Z","title":"Self-Alignment with Instruction Backtranslation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.429152Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c5dae93a12d4f19632f1f79a17503252e183ce63bb41fbb2e4ea786c7b913c2b","observation_id":"de6ae4f3-73bc-4e1c-b6fd-d12e45e74828","resolution":{"observed_at":"2026-08-02T07:29:51.429152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.564656Z","title":"Effects of social behaviors of robots in privacy-sensitive situations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.564656Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2fb0aa4a7576d3b4e9d7d6b0ab8ae76f337ad9019d518c7b5c453d32d2508287","observation_id":"99569f50-e7da-4d32-a0ec-767efd0bd7e3","resolution":{"observed_at":"2026-08-02T07:29:51.564656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.664322Z","title":"A Watermark for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.664322Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:9794c337f6c4c760742b2f8ff7c80896cd9f1a0a15e8fffdb8b35893203fe0fd","observation_id":"0a2b19a8-8cbb-420d-9d09-2a1dab977776","resolution":{"observed_at":"2026-08-02T07:29:51.664322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.707221Z","title":"Privacy and Transparency in Human--Robot Interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.707221Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:281b063c2d828220a8eec845e76d6126c54476145ee660cbf8efd748357c0e56","observation_id":"d5d896d7-1073-4092-a79e-8e36c5c9b27b","resolution":{"observed_at":"2026-08-02T07:29:51.707221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.835162Z","title":"Consent in Crisis: The Rapid Decline of the AI Data Commons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.835162Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:3d96df4393fe51c6e1279383ff719e32d4e44ada7d7ffc9e211c4927bf630fcf","observation_id":"05a97eb9-858a-4ebc-8b64-864241889547","resolution":{"observed_at":"2026-08-02T07:29:51.835162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:51.906224Z","title":"Retrieval-augmented generation for natural language processing: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:51.906224Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:b5735760115d5cdd3da22ca5da58a867b09e8eae5fbfbc2ad91e31c1edc0b561","observation_id":"fff298da-8dbb-42fb-b3b3-fe2bdb29f781","resolution":{"observed_at":"2026-08-02T07:29:51.906224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.042635Z","title":"What ' s in the Box? An Analysis of Undesirable Content in the C ommon C rawl Corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.042635Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0efc5fd74a0f6661625980494009c7f67a5834585b6c76db4c545ab51675f42e","observation_id":"bbfbe839-fb2d-45a9-8524-86c92a7dc2b2","resolution":{"observed_at":"2026-08-02T07:29:52.042635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.148202Z","title":"GRUEN for Evaluating Linguistic Quality of Generated Text","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.148202Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e1d1587319fb0b847057454e0857e7b22e0cebba391f2b665d2f1f5bd030410b","observation_id":"35db5ed3-c8e0-457f-b655-164c85bfc9bc","resolution":{"observed_at":"2026-08-02T07:29:52.148202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.212935Z","title":"Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.212935Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e4097583752a1c9f079e54247cc1e287d7805ae9c8b9c6ed407fb76042f45129","observation_id":"706b5c71-ccc9-48fb-ada2-685fa255f28a","resolution":{"observed_at":"2026-08-02T07:29:52.212935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.303445Z","title":"PlanBench: An extensible benchmark for evaluating large language models on planning and reasoning about change","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.303445Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:341cf67e217134ca9fc547d3b15fc3a977ffb626bffd9f0c142892b11867dddb","observation_id":"f132a0ac-93f9-473c-b7c4-656528fcf223","resolution":{"observed_at":"2026-08-02T07:29:52.303445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.391181Z","title":"Copyright and Generative AI: Opinion of the European Copyright Society","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.391181Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e60565c2fe15001ed4e0fe8abc79026e6c8161ba17d608162f3b8fda1f5356c3","observation_id":"4c7c4612-99f0-4262-9757-5af5f0faf66b","resolution":{"observed_at":"2026-08-02T07:29:52.391181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.492318Z","title":"Generative AI meets copyright","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.492318Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1d01abb60ebd01d48b4b9bf5a48997c53f1c4cdef8ae737be34355be52ccfd95","observation_id":"595df04d-05a2-4d7d-9d65-a86664a3d3ad","resolution":{"observed_at":"2026-08-02T07:29:52.492318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.606410Z","title":"In search of balance: text data mining and copyright in the digital single market directive from a fundamental rights persperctive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.606410Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2ab44a894e60d87337a771d97fd8423f61c53790dba61402ffc5e36bca1045a5","observation_id":"a3225d92-a84d-45a4-b1ee-9ca14ac961f9","resolution":{"observed_at":"2026-08-02T07:29:52.606410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.778636Z","title":"Copyright Traps for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.778636Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:36c22589873e8003b905f854f8b6b08b400425d6020aa71077fb81f750093db0","observation_id":"c187c479-1d3a-4f74-8a81-d97d8f96421e","resolution":{"observed_at":"2026-08-02T07:29:52.778636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:52.869813Z","title":"The Ai-Copyright Trap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:52.869813Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:57616fdce40f3ccdde3e9b82a790a279e0a30d57ebdb6ea5e5cb6a2e69578b87","observation_id":"e1fb8ff8-ec5d-4746-9de2-76bdfae6ef12","resolution":{"observed_at":"2026-08-02T07:29:52.869813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.021511Z","title":"Consent and compensation: Resolving generative AI's copyright crisis essay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.021511Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:dabf2478ee6e7423429be724c7b7f8ffffb6abf66b033f8c76898f985a865ff2","observation_id":"b2686bc1-9b8f-4455-b50c-517fbbba46bb","resolution":{"observed_at":"2026-08-02T07:29:53.021511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.108096Z","title":"We Need Smart Intellectual Property Laws for Artificial Intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.108096Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:32b6518b776b48c42bc2df8762a7557e26bdf2b2d2c15fe5c0f0bec9dd7a9d6f","observation_id":"2e557cf5-e25c-4f02-bc52-9610b5304f72","resolution":{"observed_at":"2026-08-02T07:29:53.108096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.186605Z","title":"The Data That Powers A.I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.186605Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:6f50762612a0e4619cd3b44011d194c976bc732b2503dfa45b30b877fa830ee2","observation_id":"eedb569b-c0a1-4b4b-9aa0-149d823d21b2","resolution":{"observed_at":"2026-08-02T07:29:53.186605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.250306Z","title":"The State and Fate of Linguistic Diversity and Inclusion in the NLP World","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.250306Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e2ebf489d1911daa55af56aaae7df7de930dce61832025e6e04bd69d965f8285","observation_id":"ec92b3b5-ba11-491f-b733-9183f900a7ef","resolution":{"observed_at":"2026-08-02T07:29:53.250306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.344204Z","title":"A survey of fake news: Fundamental theories, detection methods, and opportunities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.344204Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:86ae4946949ecc91b53695df92c66b7db2d2391aa5a16ef5d44577211096518c","observation_id":"274f070b-c675-4c5a-8e46-440ad68de9d0","resolution":{"observed_at":"2026-08-02T07:29:53.344204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.429489Z","title":"On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.429489Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:573c9cbbb58c894fef9e6f0290a2ab38d56d7cf9d05d235745253ca31b4a0f75","observation_id":"73b3cfdf-9324-4d3b-b825-5e03b5f104b2","resolution":{"observed_at":"2026-08-02T07:29:53.429489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.535772Z","title":"The work of copyright law in the age of generative AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.535772Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:8981783de00bc7075d79bcdd5d1134db6cfc02b9ad759c600a4b7b9cfce05950","observation_id":"916f9cbd-c7a8-4128-b207-92e3e13239c2","resolution":{"observed_at":"2026-08-02T07:29:53.535772Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.641735Z","title":"Copyright Violations and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.641735Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:673cf304ef4a007b816d1ff5853a85aad4d1e555f2058033a8762244dba1f81f","observation_id":"262addff-2a0f-4b78-88e6-d2cb0af93e25","resolution":{"observed_at":"2026-08-02T07:29:53.641735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.866628Z","title":"Detecting Pretraining Data from Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.866628Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:d1f0cac7f36d662ec95aa54616e3f45f6580316d8ff8bd91c929652eb6010dbe","observation_id":"9d61c8ca-03b9-4513-832f-17a664acd23e","resolution":{"observed_at":"2026-08-02T07:29:53.866628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:53.912311Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:53.912311Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:00e847c3ed7a20b57cee4ec7924c5c3907cf74ef96531ad77cbac79198e01fb9","observation_id":"318c38ce-17f2-4116-9b74-d0a05bb7837a","resolution":{"observed_at":"2026-08-02T07:29:53.912311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.023365Z","title":"Generative AI and Author Remuneration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.023365Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:56ba80a4d113b53ac7c73cb2d42f87ecf6ca5d4ed52985af56c556992f2252b2","observation_id":"2b547fb7-c4c8-43a0-b536-c37b08396057","resolution":{"observed_at":"2026-08-02T07:29:54.023365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.111962Z","title":"From text to talk: H arnessing conversational corpora for humane and diversity-aware language technology","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.111962Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:7b6ca413a4f56d0d71074825ddf20674c5a0dd89ab309f301055b72d6fdbbc28","observation_id":"2c8bf2d5-ffbb-4bad-b3d4-67a187b42f54","resolution":{"observed_at":"2026-08-02T07:29:54.111962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.181536Z","title":"Self-Rewarding Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.181536Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:787aa8cfa0b1125fcc6b92ac4d803f94f0f6ce24c6ae113c85fcf08a1c41d2bb","observation_id":"13797949-20d2-4fe9-b388-a06dc1b7cdb0","resolution":{"observed_at":"2026-08-02T07:29:54.181536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.267697Z","title":"Protecting User Data Through Privacy-Sensitive Robot Design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.267697Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:99f808ccfc1fd07e40668189db86995d7abf7525c905eaa049ab55b1ce274939","observation_id":"527f22b2-4135-44c1-b979-2f44a2d72f7a","resolution":{"observed_at":"2026-08-02T07:29:54.267697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.410623Z","title":"Privacy concerns in the smart home context","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.410623Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:2fa29667c23b46bef98d4a1855be51881dbc2ff89a2480e53820767fe5ac58a9","observation_id":"9191992f-46d1-4ace-9ef5-232f024bb18a","resolution":{"observed_at":"2026-08-02T07:29:54.410623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.528848Z","title":"Evaluating current automatic de-identification methods with Veteran's health administration clinical documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.528848Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:afb9262954eb22cb7b49f43414c19c02482823143ce4ec2f0725b46d69c4c20b","observation_id":"9fad8079-50ea-4229-960d-0a6bf6a3f715","resolution":{"observed_at":"2026-08-02T07:29:54.528848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.700328Z","title":"Personalised Reranking of Paper Recommendations Using Paper Content and User Behavior","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.700328Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:e3f3d6c6d55b82f773f119bfb7117404f73d2e87a7d48aa60a210ab78090b381","observation_id":"80f50fc9-8d6b-4408-b1b3-28730090b029","resolution":{"observed_at":"2026-08-02T07:29:54.700328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.767557Z","title":"Data valuation in machine learning:``ingredients'', strategies, and open challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.767557Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:8a8b43d4490e1b7e62e2f84991d575c4aeef129f3bfb6950eedcb25a5baecf5e","observation_id":"63c3bcdc-8b45-4463-9c59-b618a735d8ad","resolution":{"observed_at":"2026-08-02T07:29:54.767557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:54.855160Z","title":"Publicly detectable watermarking for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:54.855160Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:175ae5fc22b7cc685f5084591e34927062f3f54313766fd993ae19fd46854923","observation_id":"4d1f1836-cb74-4a21-8cf6-bc3f12161aee","resolution":{"observed_at":"2026-08-02T07:29:54.855160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.009143Z","title":"SMET: Semantic Mapping of CVE to ATT&CK and Its Application to Cybersecurity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.009143Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:97e2991e42a3a84f05d58ba1326081b867d28f8ae4d6869cbbd2bab061aed053","observation_id":"eda521bd-a75b-48b7-b376-5dd2e4b3f795","resolution":{"observed_at":"2026-08-02T07:29:55.009143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.120507Z","title":"A hybrid approach to dialogue management based on probabilistic rules","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.120507Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:341a3de4e0d299e381c46abe300953ad23d739c7ddf7539b57b008b06c3f3f9c","observation_id":"8de3ea6d-8174-4996-8ac5-e25086e948a5","resolution":{"observed_at":"2026-08-02T07:29:55.120507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.299546Z","title":"Situated dialogue processing for human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.299546Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:97d6faf57091b9fa3f1aa473f36bfd40c01d478093b9019f3d9bfcc9178228a4","observation_id":"1d038a91-7a28-497a-a812-a9812d2de99e","resolution":{"observed_at":"2026-08-02T07:29:55.299546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.378175Z","title":"Self-understanding and self-extension: A systems and representational approach","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.378175Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:c275132016d46bffc76baefcc4a69c473f0e5e353fb28c11292a407446bd226c","observation_id":"339777e6-2311-4bcb-9154-93b882771d70","resolution":{"observed_at":"2026-08-02T07:29:55.378175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.449621Z","title":"Spoken dialogue systems: the new frontier in human-computer interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.449621Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1030743bca7d76fb92fcdf68e7b9487ea5ab9713385a4efe97114e1dc8b48e0b","observation_id":"ea81ae36-b6c4-4622-bca7-04448269e9cb","resolution":{"observed_at":"2026-08-02T07:29:55.449621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.576661Z","title":"Automatic turn segmentation for Movie & TV subtitles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.576661Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:1cace8e23d0f4a747c0cd23c1f735fb1fce28c9fb9968e7add2dc1626b083429","observation_id":"9fb8c6eb-0297-49ba-9101-7adefde8944e","resolution":{"observed_at":"2026-08-02T07:29:55.576661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.748405Z","title":"PyOpenDial: A python-based domain-independent toolkit for developing spoken dialogue systems with probabilistic rules","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.748405Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:b55bafc6348481832e11fb8f97b83ec194df0f2c260e9ca8ec6f0171a39a5582","observation_id":"827a21ef-60ab-4896-80ff-5ac8e0423b84","resolution":{"observed_at":"2026-08-02T07:29:55.748405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.858074Z","title":"A salience-driven approach to speech recognition for human-robot interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.858074Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:d4f25c40f8f0feeccfb85f5dcec321fe3c520afd129e292eff7c187802fcadc4","observation_id":"eef6514e-9424-4b8a-86bf-b4ba895538d3","resolution":{"observed_at":"2026-08-02T07:29:55.858074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.916147Z","title":"Towards online planning for dialogue management with rich domain knowledge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.916147Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:09ccc10b4122477c37d56f9668ecb2bbc97af12eab620e0704a94e60a6808a5b","observation_id":"bb368d16-bfe7-4245-8f56-7f38329c3e98","resolution":{"observed_at":"2026-08-02T07:29:55.916147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:55.980932Z","title":"Should we use movie subtitles to study linguistic patterns of conversational speech? A study based on French, English and Taiwan Mandarin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:55.980932Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:b88cd4db3a276d4f1d90752f6dac8bef917fee66af60c22eafb1892f1786b4e3","observation_id":"7aea4570-f670-4b61-b77a-68152d042831","resolution":{"observed_at":"2026-08-02T07:29:55.980932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14312","last_updated":"2023-10-22T14:17:27Z","snapshot_observed_at":"2026-08-13T19:56:26.353930Z","submitted_at":"2023-10-22T14:17:27Z","title":"Neural Text Sanitization with Privacy Risk Indicators: An Empirical Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14312","snapshot_observed_at":"2026-08-02T07:29:56.119688Z","title":"Neural Text Sanitization with Privacy Risk Indicators: An Empirical Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.119688Z"},"links":{"cited_paper":"/paper/2310.14312","citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:dc23c370a5225a6826813e638a0acb8f677ea4ff61eb2f50893f52c1f1a88a41","observation_id":"1acbe4a8-6bc2-402d-8ad3-d2bc8eb1ebea","resolution":{"observed_at":"2026-08-02T07:29:56.119688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.230001Z","title":"Identifying Token-Level Dialectal Features in Social Media","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.230001Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:0cb6e884cb88b32be6b4a84f71a3642bf0e3895db77f1a6528188bbdd0ddbbd0","observation_id":"2786ed16-1230-4457-8e47-98a1f1cc9289","resolution":{"observed_at":"2026-08-02T07:29:56.230001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.371059Z","title":"Who's in charge? Roles and responsibilities of decision-making components in conversational robots","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.371059Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a59822e59d1f15e6a5b492106b2f9b8f3c504f32deaa08a2230cd224b92ffe65","observation_id":"6bb36b7e-580e-4bd5-a545-5faf9397ee66","resolution":{"observed_at":"2026-08-02T07:29:56.371059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.492934Z","title":"PLMmark: A Secure and Robust Black-Box Watermarking Framework for Pre-trained Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.492934Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:a835f6fa03989cb9ce892144a551245c56d09051840ccbe640ce1d0b8f086171","observation_id":"8dd9afa0-04b8-43eb-afbc-a9eed6584eba","resolution":{"observed_at":"2026-08-02T07:29:56.492934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:29:56.617980Z","title":"Three Bricks to Consolidate Watermarks for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-02T07:29:56.617980Z"},"links":{"citing_paper":"/paper/2607.10020"},"observation_digest":"sha256:91a3fc3244ff39416f5771f43d74588c208f99ef1e64f3083b2556dab8c1772f","observation_id":"4bb78c31-3a0b-41ca-85b3-7a113e5b71b0","resolution":{"observed_at":"2026-08-02T07:29:56.617980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10020","last_updated":"2026-07-15T18:51:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T07:29:43.997816Z","submitted_at":"2026-07-10T22:46:11Z","title":"FindMyText: Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 0 inbound Pith citation observations for arXiv:2607.10020."}