group-telegram.com/tech_priestess/1975
Create:
Last Update:
Last Update:
https://zadzmo.org/code/nepenthes/
Описание с сайта:
This is a tarpit intended to catch web crawlers. Specifically, it's targetting crawlers that scrape data for LLM's - but really, like the plants it is named after, it'll eat just about anything that finds it's way inside.
It works by generating an endless sequences of pages, each of which with dozens of links, that simply go back into a the tarpit. Pages are randomly generated, but in a deterministic way, causing them to appear to be flat files that never change. Intentional delay is added to prevent crawlers from bogging down your server, in addition to wasting their time. Lastly, optional Markov-babble can be added to the pages, to give the crawlers something to scrape up and train their LLMs on, hopefully accelerating model collapse.
Демонстрация работы: https://zadzmo.org/nepenthes-demo/
Tl;Dr: чел придумал софт, с помощью которого можно генерировать бесконечное количество статических страниц с мусорным текстом и ссылками на такие же мусорные тексты. Цель - загнать crawler-а (поискового робота), который пытается полностью выкачать ваш сайт, в бесконечный лабиринт, из которого нет выхода и заставить возвращать своим хозяевам тонны мусора. Предполагается, что таким образом можно испортить новые соскрапленные с интернета датасеты для будущих LLM-ок и устроить им коллапс.
Конкретно эта попытка, конечно, наивна, т.к. мусор здесь генерируется марковской цепью, а такое легко задетектировать на этапе очистки датасета перед тренировкой модели. Кроме того, такой сайт будет иметь очевидно аномальную структуру и, как следствие, быстро улетит в черный список при обходе, так что и времени на него тоже много не потратится. Но в целом идея такого адверсариального замусоривания чужих датасетов выглядит занимательно. Я легко могу себе представить более совершенную версию такого генератора, который будет создавать плохо детектируемый искусственный контент и более реалистичную структуру ссылок. Я не знаю, зачем этим занимается автор данного конкретного софта, но, возможно, какая-нибудь AI компания, создающая собственные LLM-ки, и правда в будущем начнет использовать подобное для ухудшения обучения LLM-ок конкурентов.
What a time to be alive? 🥴🥴🥴 #технокек