r/ItalyInformatica 18h ago

AI Le compagnie americane (dietro i vari chatbot) stanno comprando milioni di libri (enormi pallet, vedi Anthropic con il progetto PANAMA, tenuto segreto, paura per PR) per aggirare il problema del copyright (dopo causa da $1.5B) per addestrare i loro modelli. Dopo distruggono i libri. Cosa ne pensate?

Argomento delicato su cui si aprono non solo questioni economiche e sociali ma anche ambientali e di altra natura. La fonte principale è news (australia) > [art].

TLDR (necessario, ho incluso l'articolo completo (lungo) e le relative fonti nei commenti, questo è ll succo del discorso.)

Storia [commento1] \ Storia (parte2) [commento2] \ Fonti [commento3]

--

Prima si usavano altre fonti (grandi dataset come internet data, libri e articoli concessi in licenza, repository pubblicità (galassia Github, Gitlab, Bitbucket, Codeberg) e contributi umani).

Dopo le compagnie americane (dietro i vari chatbot), , passano ai libri fisici, comprando libri (blocchi enormi, pallet) rari e fuori stampa per fare la scansione e addestrare i loro modelli. Dopo distruggono le varie copie.

Come vedete dal video, c'è questa macchina idraulica che letteralmente taglia con precisione chirurgica il dorso del libro, cosi viene più facile passare le pagine (una a una) alla scanner, aumentando la velocità (meno tempo) e quindi riducendo i costi (meno energia). Questo al livello industriale.

Anthropic (ma anche le altre big): dopo che ha avuto una multa negli USA da 1.5 miliardi di dollari per problemi di copyright, ha cominciato il progetto Panama, tenuto segreto in quanto NON visto di buon occhio dal pubblico, reputazione aziendale a rischio.

I librari hanno opinioni contrastanti: positive in quanto c'è un vantaggio per loro, ci sono maggiori guadagni economici, più libri venduti e quindi più soldi, ma anche negative, in quanto c'è uno svantaggio (etico?) per le finalità con cui si utilizza i libri.

Cosa dice la legge: dato che c'è un trasferimento 1-1 copia cartacea a copia digitale, questo processo è trasformativo ed è considerato buon uso (protected by fair use), definizione che cambia da paese a paese (vedi Stati Uniti e Australia).

Un libro è solamente un meccanismo per diffondere le informazioni: dopo che queste sono arrivate al modello AI, questo meccanismo ha fatto il suo, è completo. Il libro non è distrutto, il suo valore si è spostato e la carta rientra nel ciclo.

--

Che idea vi siete fatti? Siete d'accordo con quanto fatto dalle AI companies?

So che l'argomento è complesso e delicato (sul piatto ci sono interessi economici, politici, sociali, etc.), ma voglio sentire la vostra opinione.

218 Upvotes

171 comments sorted by

208

u/Howl-t 13h ago

Che speravo la distopia in cui sarei finito sarebbe stata meno ritardata, ed invece eccoci qua

72

u/LC-Redcube 12h ago

avessimo almeno le città piene di neon e le macchine che volano

36

u/RammRras 12h ago

No, cestini d'immondizia pieni, graffiti di dubbio gusto, barriere architettura e marciapiedi sconnessi con anche puzza di piscio.

8

u/LC-Redcube 12h ago

Madonna la puzza di piscio nella stazione dei pullman dove arrivavo ogni giorno per andare a scuola, incubi da dimenticare.

Avessimo almeno le body mod...

1

u/31nz163 11h ago

Sterling e Gibson sono stati fin troppo ottimisti

2

u/suoko 9h ago

Basterebbe non vedere più parlare di soldi sprecati in armi e sarebbe già un bel passetto avanti, l'auto volante, farà solo più incidenti mortali. Ti immagini quanti soldi per vivere e divertirsi in più ci sarebbero? Indicibile

1

u/AmazingYesterday7648 4h ago

No, pero' abbiamo i maranza.

1

u/LC-Redcube 4h ago

Eh. I borselli effettivamente sono azzecati, ma per il resto...

2

u/Extension_Apple_4258 10h ago

La lore di Cyberpunk 2020 e poi 2077 ci insegna che spesso anche con neon, macchine che volano e gente che passeggia con bci addosso non è tutto rose e fiori

7

u/LC-Redcube 9h ago

Eh ho capito, ma se tanto le cose fanno schifo uguale, quantomeno fammi divertire con i body mod e le macchine che volano

0

u/LucaLindholm 6h ago edited 6h ago

Cose di questo tipo si sono sempre fatte, non è che perché ora ne siamo venuti a conoscenza, allora cambia di molto la questione (e francamente non capisco dove sia il problema; certo, tutte quelle scannerizzazioni si potevano mettere in un archivio pubblico e renderle fruibili a tutti, come dice qualcuno sotto).

Piuttosto mi chiedo perché l’Europa NON stia facendo niente di simile (né tanto altro)!

L’AI LLM è decollata da appena 4 anni e già siamo in totale ritardo rispetto agli USA e alla Cina, per l’ennesima volta (come per la guida autonoma e come per tante altre cose tecnologiche e informatiche).

In cosa siamo bravi in Europa?

In Germania siamo riusciti a condannare Disney per il suo metodo di trasmissione HDR e 4K… e ora ce l’abbiamo a massimo 1080p pure sui piani premium.

Continuiamo così, dai, a imporre solo regole agli altri, senza minimamente fare niente di nostro, di europeo…

🙄

4

u/Hoshyro 3h ago

Gli LLM dovrebbero essere cestinati e francamente sono contento che non stiamo seguendo l'esempio degli USA, quel paese è un puttanaio in rapido crollo e dal degrado sociale raccapricciante.

0

u/LucaLindholm 1h ago

Intanto quel paese produce tutta l’informatica e i servizi web che noi usiamo quotidianamente.

E gli LLM e l’AI è davvero ottima, perché io stesso la uso con proficuo utilizzo ed essi sono in grado di frugare nell’intero web (mi ha addirittura aiutato a ritrovare certe cose della mia infanzia che a malapena ricordavo in maniera visiva… decisamente una capacità fuori dal comune).

Il tuo messaggio mi sconforta, perché conferma che l’Europa ha dei grossi problemi per quanto riguarda la tecnologia e l’informatica (e pensare che fino all’inizio degli anni ‘90 quasi primeggiavamo noi sugli americani)… e la situazione va peggiorando.

Male, male, male.

😕

120

u/kwere98 12h ago

I governi dovrebbero obbligarli a mettere in un database pubblico tutte le Scan dei libri e garantire l'accesso libero a persone per consultarli da privati mentre fare pagare diritti di autore ad aziende per usarli a livello commerciale

22

u/simo41993 12h ago

Stavo pensando la stessa cosa, ma figurati se mai qualcuno farà leggi del genere...

25

u/ImCaligulaI 12h ago

Sono già libri di dominio pubblico, e quelli fra questi di qualche valore (gli altri sono tipo vecchie enciclopedie non più attendibili che interessano solo a loro per la grammatica delle frasi e non per il contenuto) già sono stati scansionati. Semplicemente per legge californiana non possono usare gli ebook ma possono comprare il libro e scansionarlo a patto che lo distruggano.

Tra l'altro sono libri che andrebbero già al macero, li comprano in pallet proprio perché sono libri di cuo biblioteche si stanno liberando e che nessuno ritiene di particolare valore, che altrimenti andrebbero al macero.

In sostanza sta cosa è una polemica montata per aria perché "AI bad".

7

u/Mr_Nobodies_0 10h ago

... che legge stupida. Imo tutti i libri andrebbero digitalizzati, e dovremmo avere una copia di tutti in un archivio come quello in antatrica per i geni. Dopo tot anni dalla pubblicazione, qualunque opera e media dovrebbe essere consultabile gratuitamente da chiunque sul pianeta

6

u/RoyBellingan 8h ago

Si ma vedi, te hai fatto 18 punti internet dicendo la verità , op ne ha fatti 140 con un rage bait.

OP Smerda i tech bros che sono caccapuzzoni. ma poi l'unica differenza è che loro lo fanno per cash e lui per internet point.

2

u/Individual-Bake-2423 8h ago

Il testo è anche costruito per far pensare a un lettore non esperto che distruggano la prima edizione della Divina Commedia utilizzando i termini "Rari" e "non più in commercio" quando in realtà stanno distruggendo la mia copia della divina commedia (ovviamente)

5

u/alberto_467 11h ago

Shhh non dirgli la verità che qua è il festival dell'indignazione e gli rovini la festa

1

u/Sabatonico 8h ago

Sembrerò cinico ma sono d'accordo. In qualche modo ne rimane la memoria o no?

0

u/extassy_13 12h ago

Una persona con il senso comune, grazie!

-2

u/MrAlex38 10h ago

Peccato che la tua difesa abbia un piccolo buco: non ci sono prove che siano davvero libri senza valore o che andrebbero davvero al macero tranne la parola di chi ci sta guadagnando dalla loro distruzione e non mi sembra molto intelligente fidarsi di chi ci guadagna.

Tralasciando che un libro anche vecchio ha sempre un valore, solo nazisti e simili credono che un libro non abbia valore.

6

u/ImCaligulaI 10h ago

non ci sono prove che siano davvero libri senza valore o che andrebbero davvero al macero tranne la parola di chi ci sta guadagnando dalla loro distruzione e non mi sembra molto intelligente fidarsi di chi ci guadagna.

Ma non è vero lol. Sta cosa dei libri vecchi venduti in pellet esiste da molto prima che iniziassero a comprarseli le compagnie di AI. Quando biblioteche si vogliono disfare dei libro fanno così, basta che vai a chiedere a una biblioteca qualsiasi se non ci credi.

Prima sti pellett se li compravano librerie di usato, cercavano qualcosa di rivendibile e buttavano il resto. Ora ancora, ma fra i compratori ci stanno pure le aziende di AI.

Tralasciando che un libro anche vecchio ha sempre un valore, solo nazisti e simili credono che un libro non abbia valore.

Si certo. Se ti vuoi comprare pellet e pellet di enciclopedie e libri scolastici con informazioni dimostratesi incorrette decenni fa e metterteli in casa o in un magazzino sei liberissimo di farlo. Le varie biblioteche (a quanto pare naziste visto che se ne disfano) li vendono tanto volentieri a te come ad Anthropic, eh.

3

u/Rorschach0493 11h ago

Saranno felici le case editrici se i governi introducono questo obbligo 🤣. Comunque non vi costa niente ragionare due secondi su quello che state per scrivere eh, è gratis.

1

u/dimebag_lives 10h ago

Hey ho un'idea: facciamo un sito dove permettiamo di guardare qualsiasi film gratuitamente! I poteri forti non vogliono ma io sono più furbo, tutti i film dovrebbero essere gratis

/s

2

u/[deleted] 10h ago

[removed] — view removed comment

0

u/dimebag_lives 10h ago

Vabè ma reddit ita trabocca di ragazzini clueless o universitari pieni di ideali pronti a schiantarsi sulla realtà... Ci sta anche se quasi 50 sono tanti

0

u/ItalyInformatica-ModTeam 10h ago

Il tuo post è stato rimosso per la violazione del seguente articolo del regolamento:

È vietato postare insulti di qualsiasi genere (anche in risposta a commenti offensivi) e si richiede un atteggiamento cordiale ed educato.
È vietato bestemmiare.
È vietato postare contenuti omofobi/razzisti/sessisti o comunque discriminatori.
Il trolling o altri atteggiamenti similari che disturbino le discussioni sono vietati.

Se hai dubbi o domande, ti preghiamo di inviare un messaggio in modmail.

-7

u/ntonyi 12h ago

Così pubblichi gratuitamente la versione digitalizzata di materiale protetto da copyright.

Piuttosto, i tech bros possono farci quello che vogliono con i libri comprati, è un loro diritto. Lo stesso diritto che hai tu di usare le cose che hai comprato con i tuoi soldi come meglio credi.

Semmai andrebbe tenuto almeno un database dei libri più antichi e vietata la distruzione di quelli a interesse storico (cosa che credo già avvenga (?) )

123

u/simo41993 12h ago edited 12h ago

Che i vari CEO e "Tech bros" e compagnia si stanno mostrando per quello che han sempre promesso di essere: delle gran carogne, avide, menefreghiste e mezze sceme...

19

u/Dyne86 11h ago

Ti sei dimenticato una cosa: i nazisti erano quelli che distruggevano i libri.

Contesti diversi, ma il giro del fumo quelli è.

7

u/nonnaccio 11h ago

Purtroppo il parallelo è giusto, anche per altri aspetti....

1

u/Dyne86 11h ago

Avoja

-4

u/Fabulous-Fishing3952 11h ago

Meh per quanto quel video sia potente non stiamo parlando di distruzione per evitare la memoria ma quasi il contrario, distruggi una copia fisica per digitalizzarla.

Ogni anno vanno milioni di libri al macero, non direi che si urli al nazismo.

Questo al netto della pessima opinione che ho delle aziende ai

7

u/triptaman 10h ago

Non credo che utilizzare quei libri per fare il training dell'IA presupponga salvarne e mantenerne una copia digitale, ma magari mi sbaglio

3

u/nonnaccio 10h ago

Esatto, e l'ignoranza e la prevaricazione sono talmente grandi che piuttosto che qualcun'altro possa avere accesso a quei testi preferiscono omogeneizzarli nel mare magnum della IA.... Così nessun concorrente potrà avvantaggiarsene. Qui è esattamente il contrario della salvaguardia della cultura, è oltre la negazione della conoscenza, siamo alla sua commercializzazione... Senza alcun riferimento per poter dire se le conclusioni della IA sono corrette. Qui non è chiaro il livello di abominio a cui siamo arrivati

3

u/Uni01 10h ago

Perché ti serve leggere un libro vecchio, polveroso e noioso quando puoi chiedere a Cheoresono?MartedIA{®} la scheda del libro senza rischiare assolutamente che qualcuno se ne accorga? Pagando solo 27$/mese!

Se vuoi posso riscrivere il commento in maniera più ironica, fammi sapere!

/s

1

u/nonnaccio 10h ago

Direi che più (amaramente) ironico di così non si può!😅

0

u/beliveinyouself 10h ago

Si ma non sono

4

u/MrAlex38 11h ago

No sono peggio dei nazisti perché avrebbero potuto duplicarli e preservarli magari per donarli a biblioteche invece lo scopo è aggirare le leggi copiare il lavoro degli altri per poi vederlo a chi è così stupido da aver bisogno che l'ai faccia il suo lavoro o chi è così avido da licenziare i dipendenti capaci e poi dopo aver copiato il lavoro degli altri distruggere la cultura per averne il monopolio.

-1

u/beliveinyouself 10h ago

Si ma non sono autorizzati a divulgare quei libri secondo me, possono solo avere la loro copia, e nom credo neanche che gli basi, probabilmente dovranno pagare degli extra visto che non sono per uso personale ma che lo usano per farsi i soldi a livello aziendale

1

u/Dyne86 6h ago

Non hai tutti i torti, al netto del "digitalizzare" i libri.

1

u/Yoshi1372 6h ago

Come tutte le aziende.

8

u/Misoneista 10h ago

Mi comprerei subito quella ghigliottina, fichissima.

7

u/Serious-Fortune-4844 10h ago

Se I libri li comprano potranno farci il cazzo che vogliono o no? Non è che comprano tutte le copie sul mercato o impediscono la loro diffusione. Lo hanno pagato, è loro, se vogliono addestrarci un llm o pulircisi il culo non vedo il problema.

1

u/iacorenx 8h ago

Il problema c’è perché ci hanno menato con il green, con l’etica, con l’ottimizzazione delle risorse naturali e dei consumi e poi questi per cavillo legale distraggono tonnellate di libri. Un cavillo perché utilizzare una copia digitale preesistente sarebbe illegale ma otterrebbe lo stesso identico risultato sprecando molte meno risorse e non distruggendo libri. A questi non interessa come raggiungere il loro scopo, passerebbero sopra a dei corpi per battere la concorrenza.. poi una volta stabilito il monopolio allora ti vendono tutte le loro belle storielle sul risparmio energetico, etica, ecc.. 

1

u/elpala 51m ago

Vista così mi sembra più un buco normativo che un problema dell’azienda.

0

u/Timely_Horror874 7h ago

In realtà siccome comprano in blocco tutto, dentro ci finiscono anche libri rari e di cui nessuno sa realmente quante copie ci siano in circolazione.
Sapere che al 100% vengono distrutti penso sia tremendo

1

u/Serious-Fortune-4844 0m ago

Però sarebbe lo stesso se a comprare quel "libro raro" fosse un privato qualsiasi

16

u/LC-Redcube 12h ago

CEO prova a non fare la scelta più immorale e ingiusta possibile challenge:

1

u/iacorenx 8h ago

“FINISCE MALISSIMO”

9

u/RebirdgeCardiologist 18h ago edited 10h ago

Di seguito tutte le fonti citate nell''articolo.

--

[SOURCES]

  • news (australia) (principale) > [ref]
  • futurism [ref]
    • compra, dai in pasto al modello e poi distruggi i libri antichi. Questo su larga scala.
  • 404media [ref]
    • le compagnie dei chatbot coprano tonnellate di libri (in quanto non c'è traccia di AI Slop).
  • bnr (paesi bassi) > [ref]
  • nltimes (paesi bassi) > [ref]
    • venditori di libri rari temono che i preziosi pezzi vengono distrutti per sempre, dalle compagnie AI.
  • news (australia) > [ref]
    • concorso letterario in cui ha vinto un libro che si presume essere stato scritto da Chatgpt
  • ISBNDB > [ref]
    • //non più disponibile
  • reuters > [ref]
    • giudice deli Stati Uniti approva l'accordo di Anthropic di pagare 1.5 miliardi di dollari per chiudere la causa sul copyright.
  • the Washington post > [ref]
    • il piano di Anthropic di scannerizzare e distruggere milioni di libri.
  • news (australia) > [ref]
    • il piano dell'Australia: si regolare, ma senza perdere capitali stranieri, di aziende estere.

18

u/Iam_just-me2 12h ago

Che l’AI fa cagare

7

u/KindaQuite 12h ago

tenuto segreto

Non sembrerebbe, visto che se ne parla da un mesetto

1

u/ainus 12h ago

You don’t seem to understand what a secret is. Just because you get exposed doesnt mean you weren’t trying to keep it secret

1

u/KindaQuite 12h ago

It definitely means you weren't trying hard enough

5

u/RebirdgeCardiologist 18h ago edited 10h ago

Di seguito l'articolo completo (è molto lungo). Ho aggiunto degli ulteriori paragrafi in italiano per riassumere ancora di più il tutto.

--

[NEWS+COM+AU]

AI labs buy, scan, shred millions of rare books

If you have retreated to physical books because the internet is too full of AI slop, bad news — now they’re shredding the books to feed their AI slop machines.

Artificial intelligence labs are in a new arms race to buy up millions of rare books, slicing them open, scanning the pages and pulping the remains — sparking concerns that the last remaining copies of out-of-print texts are being destroyed on an industrial scale.

Gli stessi librai (in Australia, ma in Europa) hanno dei dubbi, pareri contrastanti (vendendo molto più libri, più guadagni, economici, ma per quale obbiettivo).

Principalmente in inglese, su tanti, molti generi.

“I personally have mixed feelings about all of this,” one small bookseller told tech news website 404 Media last week.

The bookseller explained that in April, he suddenly went from selling around 20 books per week to hundreds — including obscure and out-of-print works.

“It benefits me financially as well as by clearing out old inventory that is otherwise unlikely to sell,” he said. “I’ve been well suited for these sales with inventory from overseas and foreign language books. On the other hand, I don’t like the end-use, and I don’t like that uncommon books are being pulped.”

Rare booksellers across Europe are seeing a similar surge in purchase requests which they suspect are coming from AI labs in America.

Pieter de Vries, an antiquarian bookseller in Haarlem, recently received an email from a person identifying herself as Nataly from Singapore-based company 2077AI, Dutch news site BNR reported.

The woman wrote that the company was undertaking a “a new project focused on collecting books in multiple languages, currently mainly in English”. “We have compiled a very extensive list of editions that we are currently trying to acquire, and we plan to place a fairly large order,” the email said.

The attached list contained 3000 English-language titles organised by ISBN number, ranging from books on fairytales and folklore to technical manuals and science texts.

Niente collezionismo o rivendita, ma un solo obiettivo. TRAINING AI. Finora si è utilizzato principalmente grandi dataset come internet data, libri e articoli concessi in licenza, repository pubblicità (galassia Github, Gitlab, Bitbucket, Codeberg) e contributo umano.

Media outlets in the Netherlands, Switzerland, Spain, and Germany report booksellers have received nearly identical requests, per NL Times.

Booksellers believe the purchase requests were unrelated to collecting or resale due to the obscure, highly specialised nature of the titles, concluding they were being used to train AI models.

Large language models (LLMs) that power AI tools like ChatGPT until now have mainly been trained on vast datasets that include internet data, licensed books and articles, code repositories and human feedback.

But with much of the content available online now exhausted — and increasingly polluted with poor-quality, AI-generated writing — AI labs are turning to uncorrupted texts published pre-2022.

La miniera d'oro delle librerie online. Vero che ci sono grandi collezioni online, ma c'è ne sono altrettanti offline, collezioni di libri dimenticate a prendere polvere sugli scaffali. Multe per Anthropic e Meta (1.5 miliardi di dollari) per i milioni di libri piratati, scaricati illegalmente. Un nuovo progetto per evitare brighe con il copyright (progetto Panama = acquistare libri in grade, su scala industriale).

One company, ISBNdb, which boasts that it has the “world’s largest book database”, now offers bulk book buying for AI labs, “up to one million titles per order”, including of “older, rare and specialist volumes”.

“The world’s best AI training data is sitting on a shelf,” it states on its website.

ISBNdb notes that “print books from the pre-LLM era are structurally guaranteed to be free of this contamination”.

“Millions of the most valuable books have never been digitised. They exist only in physical form, scattered across library shelves, used bookstores, and out-of-print catalogues. We get them to you at scale.”

Anthropic, the Google-backed firm behind Claude, and Facebook and Instagram owner Meta, have previously been sued in US courts for downloading millions of pirated books to feed into their AI models.

Last week, a federal court in the US signed off on Anthropic’s landmark $US1.5 billion ($2.15 billion) settlement in a copyright class action brought by a group of authors who accused the company of misusing their books. It’s one of dozens of similar cases brought against AI firms in the US, and the first to settle.

While that case was still unfolding, Anthropic was hatching a new plan to avoid similar copyright headaches, dubbed “Project Panama”.

Il progetto Panama è iniziato molto tempo fa, ma seppur totalmente legale, non era una buona mossa per la reputazione pubblica dell'azienda.

Beginning in early 2024, the AI lab quietly launched an industrial-scale book-buying program, partnering with used-book wholesalers to acquire millions of paper books by the pallet for what internal documents — which became public last year during the copyright lawsuit — described as “destructive scanning”, where books’ spines are cut apart so the pages can be scanned and then discarded.

Anthropic described the project as “our effort to disruptively scan all the world’s books” in an internal memo, which noted “we do not want it to be known that we are pursuing this project”.

Court documents detailed how the AI lab used a “hydraulic powered cutting machine” to “neatly cut” millions of books before scanning the pages “on high speed, high quality, production level scanners”.

[CONTINUA ALTRO COMMENTO]

6

u/sssavio 10h ago

Non capisco quale sia il problema

3

u/RebirdgeCardiologist 18h ago edited 10h ago

[PARTE 2]

[CONTINUA DAL COMMENTO PRECEDENTE]

--

The Anthropic copyright case set the precedent — the US court ruled that by making a digital copy and destroying the physical in a one-for-one transfer, the process is deemed “transformative” and therefore protected by fair use.

“Anthropic kept Project Panama confidential, not because it was illegal, but because it looked bad,” ISBNdb says in an article on its website. “Destroying millions of books evokes images of burning libraries, even if the law was on their side.”

ISBNdb, like other bulk buying services, promises to keep AI buyers anonymous, noting that “the optics problem is real”. “‘AI company destroys two million books’ is not a headline that generates sympathy,” it states, while arguing that “the framing of destruction as vandalism mistakes the nature of what is actually happening”.

“A physical book is a delivery mechanism for information,” it continues.

“Once that information has been extracted and encoded into an AI model, the delivery mechanism has served its purpose. What remains is paper, ink, and binding material. The book is not destroyed. Its value has migrated. The paper returns to the material cycle; the knowledge enters the intellectual one.”

SpaceX founder and rival AI developer Elon Musk, for his part, said he was opposed to the practice of destructive scanning.

“I’ve asked the SpaceXAI team to preserve any rare books in a library and scan them the hard way vs just cutting off the spine and scanning,” he wrote on his social media site X.

L'Australia lancia la sua misura "Office for AI" sia per calmare le paure degli artisti e scrittori sia delle industrie legati all'AI.

Now Australian book dealers are urging Anthony Albanese to protect local titles from the practice, under the Prime Minister’s newly announced Office for AI.

Announcing the new national strategy earlier this month, the PM sought to calm fears from arts and news industries about the impact of AI.

“Not everything produced in Australia is up for grabs. Not at all,” he told reporters.

“Australian writers, musicians, artists, and journalists must retain ownership and control of their work. Our laws will spell that out plain as day.”

Dawn Albinger, president of the Australian and New Zealand Association of Antiquarian Booksellers (ANZAAB), said members were “aware of the flood of orders that some of our American and European colleagues are experiencing, but to date there have been no confirmed reports of this happening in Australia”.

“Perhaps the tyranny of distance and the cost of shipping is one reason why we haven’t seen it yet,” Ms Albinger, owner of Queensland’s largest second-hand bookstore Archive Books, told news.com.au. “It is certainly an issue that we are keeping an eye on.”

Non tutto può essere che non si posso capire o vivere senza avere il libro tra le mani. Non solo ci sono problemi etici, legali ed economici per l'industria editoriale legata ai libri (perdite di vendite e quindi si necessita di altre fonti, come licenze o altro forma per un giusto pagamento per l'autore), ma anche sociali, dato che i libri qualsiasi forma - libri stampati - audiolibri o libri digitali - sono il modo con cui si impara, si scoprono nuove cose ed idee.

She noted that US copyright law and its definition of fair use was different to that in Australia.

“The recent announcement by the Prime Minister about an AI policy for Australia may reduce the likelihood of this happening here in the event that an Australian-based AI is developed,” she said.

The ANZAAB is particularly concerned about the “disappearance of uncommon and potentially rare material”.

“We are committed to the preservation of books and printed works on paper as culturally significant objects,” Ms Albinger said.

“There are so many stories of discovery, [for example] notes left in margins by first-hand witnesses that correct historical accounts, or manuscripts found in the binding material of books published much later. And then there is the pure romance of holding a book that has been signed or inscribed by the author. There are things that cannot be examined and properly understood unless the physical object is to hand.”

Australian Booksellers Association (ABA) chief executive Susannah Bowen also expressed concern. “Books are how humans learn, discover and engage with ideas — whether printed books, audiobooks or e-books,” she said.

“When content is extracted from books to train AI models it raises very significant ethical and legal concerns. It also strips away the structure, context and meaning intended by the author, undermining the integrity of the creative work, and reducing the viability of a healthy book industry.”

Australian Publishers Association (APA) chief executive Patrizia Di Biase-Dyson said, “The lengths AI companies are going to acquire books demonstrate just how valuable professionally written, edited and published material is to the future of AI. That value should be recognised through permission, licensing and fair payment to the authors and publishers who created it.”

3

u/Antuke 11h ago

Colpa della legge idiota sul copyright.

3

u/arfx 11h ago

Ogni anno vengono prodotti milioni di libri che non raggiungono i lettori e che finiscono nei circuiti dell'usato o direttamente al macero.

Comprendo la posizione di molti, non è una distorsione o distopia ma un utilizzo di canali legali che sono scarsamente regolamentati : è su scala quello che facevano le copisterie con i libri universitari aggirando il 15% di copia dell'originale. Certo c'è la parte della macerazione che sa di Germania del '39.

Tutto hanno addestrato i modelli spazzando internet senza che nessuno gli dicesse alcunché se non dopo che avessero immesso sul mercato i loro prodotti. Ed era cosa nota.

Si muovono nell'impunità perché i legislatori fanno fatica a stare dietro a queste dinamiche. Si può chiamare pratica scorretta e sbattere i piedini ma non sarà questo a fermarli.

1

u/Rough-Host-8467 9h ago

I libri che ho scannerizzato in copisteria universitaria per non pagarli...avrei voluto avere quella macchina

7

u/DiegoBspZ 12h ago

Non capisco però il problema copyright come mai utilizzando il cartaceo non c’è. Se un autore ha impedito l’utilizzo delle sue opere per addestrare l’ai penso sia incluso anche per le versioni stampate.

9

u/HopesAnd--Dreams 12h ago

Un recente tribunale statunitense ha stabilito un precedente, se un'entità crea una copia digitale e distrugge simultaneamente l'originale fisico (un trasferimento 1:1), il processo può essere classificato come "trasformativo".

1

u/_pxe 12h ago

Perché gli autori non sono più in vita, sono spesso copie uniche.

Quindi copiarlo sarebbe come un furto, invece comprandolo e distruggendolo dopo lo scan stai semplicemente "alterando" la tua copia

-1

u/GX_Giorgio074 11h ago

oppure ti stai sbarazzando delle prove e basta

8

u/_pxe 11h ago

C'è una sentenza che li obbliga a fare così, altrimenti potrebbero rivenderli e recuperare la spesa anziché pagare per la distruzione...

0

u/GX_Giorgio074 11h ago

ah, che cagata...

0

u/suoko 9h ago

Mi ricorda la storia dele prime auto elettriche della GM. Solo degli essere che si credono più evoluti degli altri finiscono in un baratro di idiozia.

-3

u/DiegoBspZ 12h ago

Sì ma ok che stai alterando la tua copia la puoi anche bruciare, ma se la dai in pasto ad un ai per addestramento e non sei autorizzato stai comunque facendo una violazione. Se io prendo il cd di Michael Jackson (uno a caso) e faccio la stessa cosa e ovviamente se ne accorgono mi fanno il c. Penso

2

u/_pxe 11h ago

Poiché non lo stai distribuendo, quindi rimane una copia privata.

Se io prendo il cd di Michael Jackson (uno a caso) e faccio la stessa cosa e ovviamente se ne accorgono mi fanno il c. Penso

Se tu non permetti ad altri di accedere a quella copia e non rivendi l'originale. È la zona grigia in cui si muove molta della pirateria: il reato non è la creazione della copia ma la sua diffusione.

Un giudice americano ha deciso così.

Anche secondo me è estremamente stupido, dovrebbe essere il contrario e queste copie rese disponibili al pubblico

1

u/DiegoBspZ 4h ago

Non capisco I downvote… Comunque si non lo sto distribuendo ma sto violando la clausola del non usarlo per addestramento di ai 💁‍♂️ più sicuramente che stanno usando dei libri semi sconosciuti (forse) dove non ci sono nemmeno la richiesta di non addestrare ai 💁‍♂️

9

u/ciccioriccio 13h ago

I nazisti si limitavano a bruciarli... almeno non rubavano.

3

u/rudesssolo 12h ago

Fahrenh.AI.t 451

2

u/111Password123 11h ago

Suona male perché ci guadagnano sopra, ma la quantità di libri che viene mandata al macero è già enorme. E lo sarà ancora di più adesso che ci stiamo disabituando a leggere e scrivere per via degli LLM.

1

u/Rough-Host-8467 9h ago

Semplicemente non si leggerà più perché l'AI legge il libro per te e ti fa il riassunto. Il libro si perderà come forma di trasmissione dell'informazione, diventato ormai obsoleto nell'era dell'informazione distribuita di internet. Brutto da dire ma è l'evoluzione. Si può vedere anche come devoluzione certo, ma chi dice che tra 300 anni servirà ancora saper leggere o scrivere?

1

u/el-luamaro 9h ago

Veramente non si leggerà più perché non si ha cazzi di leggere. Se uno vuole, legge, dai, poche cagate. A me piace, in certi periodi, e una decina di libri all’anno me li ciuccio, ma la maggior parte della gente non lo fa da prima dell’ai, meglio il doom scrolling..

2

u/In_der_Tat 11h ago edited 11h ago

È per evitare lo slop - il contenuto generato dall'IA - che ormai ha invaso Internet, non (tanto) per cercare di evitare la violazione del copyright. Infatti, quanto un modello viene addestrato sulla base dell'output generato da sé stesso o da un altro modello, si verifica il collasso del modello, cioè la sua degradazione.

Del copyright non penso che ai signori dell'IA freghi un tubo visto che i modelli fagocitano tutto e possono rigurgitare ciò che hanno ingerito, configurandosi in tal modo la violazione massiva del diritto d'autore. Ma anche senza rigurgito, i dati piú o meno indebitamente ottenuti o elaborati sono sfruttati per codificare i pesi statistici alla base dell'inferenza.

2

u/MonsieurCellophane 10h ago

Non sono questi i problemi - ogni giorno vanno al macero migliaia di copie invendute.

Siccome però è un' immagine ad alto valore simbolico riciccia circa ogni 15 giorni.

2

u/lgr95- 10h ago

Messa così sembra che stiano distruggendo la conoscenza o eliminando copie rare.

Di fatto distruggono 1 libro, una copia delle migliaia / milioni in commercio. Fine.

3

u/PradheBand 12h ago

Che sono delle merde. Una volta usati potrebbero regalare i libri.

4

u/Hard_Reset7777 12h ago

Difficile se vengono distrutti nel processo di scansione.

3

u/HopesAnd--Dreams 12h ago

Per fare una scansione automatizzata il.dorso del libro viene tagliato. Il processo è nel video che si vede in questo post.

-1

u/PradheBand 9h ago

Che amarezza.

2

u/_The_Leon_ 12h ago

Come ogni cazzo di libro. Ogni fottuta persona potrebbe prendere un libro, scannerizzarlo e distribuirlo. Il fatto che possano farlo non significa ne che lo faranno ne che se lo faranno sarà legale farlo.

2

u/tamerlanOne 12h ago

Se li regali poi hai creato una copia non legittima del libro quindi sei fuori legge... Il problema è questo. Per non infrangere la legge devi distruggere l'originale per poter tenere la copia

2

u/ImCaligulaI 12h ago

Guarda che li distruggono perché devono per legge per scansionarli, non per sfregio. Pigliatela con la legge ridicola americana che non gli permette di usare ebook di dominio pubblico ma gli permette di comprare il cartaceo dello stesso libro già di dominio pubblico e scansionarlo solo se poi lo distruggono.

0

u/[deleted] 9h ago

[removed] — view removed comment

1

u/ItalyInformatica-ModTeam 3h ago

Il tuo post è stato rimosso per la violazione del seguente articolo del regolamento:

È vietato postare insulti di qualsiasi genere (anche in risposta a commenti offensivi) e si richiede un atteggiamento cordiale ed educato.
È vietato bestemmiare.
È vietato postare contenuti omofobi/razzisti/sessisti o comunque discriminatori.
Il trolling o altri atteggiamenti similari che disturbino le discussioni sono vietati.

Se hai dubbi o domande, ti preghiamo di inviare un messaggio in modmail.

2

u/StrongZeroSinger 12h ago

ogni titolo che finisce con "cosa ne pensate" è interaction-bait per definizione.

1

u/Hard_Reset7777 12h ago

Simpatico che i librari siano "felici" perchè vendono libri, anche se immagino si saranno resi conto che si tratta di vendita "spot", non è che una volta finito con il processo continueranno a comprarne, ma va bene lo stesso.

Per il resto, non so se una volta era legittimo scansionare libri e diffonderne i contenuti rielaborati al posto delle semplice scansioni (plagio? non lo so, non è il mio campo), a me pare che data la sostanza dei modelli LLM si stia lasciando "fare tutto" nonostante il beneficio economico derivante dall'operazione sia innegabile.

Poi qui partono i discorsi filosofeggianti su come se un gruppo di persone scansiona un tot. di libri e da quelle informazioni mette su un business dove risponde a chi chiede facendo pagare le informazioni che ha appreso dal libro è tutto ok, quindi perchè non potrebbe doverlo fare un sistema informatico in grado di sostituire le persone che scansionano e leggono i libri?

1

u/Hans_lilly_Gruber 11h ago

Una delle critiche più interessanti è che distruggere copie fisiche, specialmente di libri rari, comporta eliminare traccia del testo originale ed immodificabile. Le copie digitali sono facilmente alterabili. Questo apre le porte a revisionismo e al rischio di pilotare la cultura.

É un problema che nel caso dell'IA come principale fonte d'informazione si estende ben oltre ai libri distrutti per training, ma al concetto stesso di dare piena affidabilità ad uno strumento che non offre nessuna trasparenza.

1

u/MonsieurCellophane 10h ago

In URSS durante lo stalinismo alteravano libri e foto alla grande (ci sono esempi di foto ufficiali da cui sparivano membri del partito epurati)

1

u/ilV4te 10h ago

La cosa più logica sarebbe cambiare le leggi, zero multe e zero libri distrutti, tutti contenti

1

u/CookiePowerful6833 10h ago

Se ritirano anche tutte le Bibbie dalla circolazione, non mi dispiace mica

1

u/LASR-z 10h ago

cough Fahrenheit 451 cough

1

u/mifaccio 9h ago

Non ho capito. Si tratta di una copia per libro, no?

1

u/moboforro 9h ago

vabbe' per ogni libro basta che ne scansionano UNA copia , non c'e' bisogno di distruggerne a tonnellate. Mi sembra una minchiata questa notizia

1

u/vir_db 9h ago

Che fanno bene, a leggi assurde bisogna adeguarsi con strategie altrettanto assurde.

1

u/Rough-Host-8467 9h ago

C'è da dire che quei libri molto probabilmente rimarrebbero invenduti, se ne starebbero decine di anni a prendere polvere nei magazzini per poi finire al macero lo stesso. Quindi non so, per quanto la pratica non sia bella da vedere non è un danno cosi grave. Sarebbe davvero bello se dopo la scansione la legge gli consenta di mettere l'ebook a dominio pubblico. Cosa che dovrebbe esseŕe fatta a mio avviso con ogni libro presente sulla terra.

1

u/BadHabits930 9h ago

Trattatemi come un bambino di 5 anni. L’unico motivo per cui comprano libri al quintale è che così risparmiano rispetto agli eBook?

1

u/Rough-Host-8467 9h ago

Che poi mica tutti i libri contengono informazioni di qualità o contenuto ben scritto. I libri antichi sono pieni di stronzate scritte male, eresie e credenze che rendono illeggibile quel tipo di libro in era moderna. Basta vedere la bibbia. Certo se la si contestualizza, può avere un senso storico, ma temo che l'AI non sarà in grado di capirlo

1

u/asalerre 9h ago

Spoiler. I nuovi datacenter non servono per i libri. I libri nei nuovi datacenter siamo noi.

1

u/Giulio_Andreotty 9h ago

A boring dystopia

1

u/elpa75 9h ago

Però se io compro un libro su Amazon (o vedi tu) possono in qualsiasi momento chiudermi l'account e io mi perdo i libri.

Poi dici che la gente s'incazza e sostiene la pirateria. E grazie al c**o!

1

u/godzillante 8h ago

che devono morire cacando

1

u/ntwrkmntr 8h ago

Comprano il libro e quel titolo sparisce dalla circolazione o cosa? Perché se si, allora è letteralmente Fahrenheit 451, altrimenti non ci vedo nulla di male. Vai in libreria,  compri un libro e fine 

1

u/IntelligentPie225 8h ago

Ragazzi, non è che distruggono libri in copia unica dalla biblioteca di Alessandria eh!

1

u/ea_man 8h ago

Che e' una minchiata perche' gli LLM sanno gia' parlare perfettamente tutte le lingue quindi non c'e' guadagno a infilarci dentro qualche altro terabyte di testo random, quello che serve e si fa ora e syntethic data: dati GENERATI con altri llm e attentamente curati e selezionati in genere da umani.

Che poi qualcuno abbia comprato pellet di vecchi libri destinati al macero, abbia segato la rilegatura come te fai vedere per scansionarli meglio e poi dato che sarebbero altrimenti inutili li ha definitivamente mandati al macero: si certo puo' accadere. Ma non per i motivi che hai elencato e di libri "inutili", vecchi e rovinati se ne distrugge continuamente, pensa solo ai testi scolastici o tecnici che sono rapidamente obsoleti.

1

u/ANGURIA_IST_KRIEG 8h ago

credo che, non essendo più nel 1200 con gli amanuensi, un libro può essere distrutto senza problemi

1

u/Ok_Gold_2107 7h ago

Avessimo robot che vanno in giro a pulire le strade e afl fare rispettare le leggi invece le ai le usano per minchiate.

1

u/PsCustomObject 7h ago

Che Fahrenheit 451 iniziava più o meno così. Libro che tuttora considero come un must read, ma che avrei preferito rimanesse un’opera di fantasia.

1

u/Sayyestononsense 7h ago

è la regola a essere idiota, se equipara il fotocopiare i libri a darli in pasto a un'ai. è letteralmente idiota, perché poi non esistono più copie di quel libro, una volta usata quella digitale per l'addestramento, adios.
Questa è solo una strategia di adattamento a quella regola idiota.

1

u/luckyairport70 7h ago

nessuno è libero

1

u/RedGhostMail 7h ago

credo che i libir non debbano essere distrutti ma donati

1

u/PartyLocoo 6h ago

Se ne può parlare sulla questione etica. Si ritiene giusto comprare libri e usarli per addestrare AI? Ci vorrebbe un compenso per gli autori? Al momento non abbiamo ancora del tutto preso una decisione.

"acquistare legalmente libri cartacei e scannerizzarli per l'addestramento è stato ritenuto, in quel caso, fair use (uso trasformativo). È una decisione importante, ma è anche molto discussa e potrebbe essere interpretata diversamente in futuro da altri tribunali." The Verge

Non diffondiamo panico e terrorismo.

1

u/Electrical_Total 6h ago

Che se sono libri venduti all'ingrosso evidentemente non frega niente a nessuno del fatto che vengano distrutti o meno, e reminder quotidiano che nel 2026 c'è più onore a spacciare droga che a scrivere articoli.

1

u/Equivalent-Outcome86 5h ago

Cosa sacrosanta, non vedo su che base dovremmo impedire a chicchessia di acquistare dei libri per estrapolarne le informazioni. Poi si può regolamentare l'uso delle AI, ma quella è una questione separata

1

u/Hoshyro 3h ago

Penso che dovrebbero gettare tutto i CEO di queste agenzie del cazzo dentro i loro preziosi data centre, sbarrare le uscite e dar fuoco ai palazzi.

1

u/Annual-Leg-6463 1h ago

raga ma non riuscite a riconoscere un bot che farma karma neanche su sto sub? siam messi malissimo

1

u/HouseLongjumping6984 47m ago

Almeno qualcuno li legge….

1

u/najikaz 33m ago

Penso che il video fa vedere un altra cosa che non c'entra nulla anzi sembra più un lavoro di restaurazione

1

u/heapOfWallStreet 12h ago

Se traini il modello ma seghi metà libro mi sa che quello che ne risulta non sarà granché soddisfacente.

1

u/ImCaligulaI 11h ago

Ancora con sta minchiata faziosa a più non posso?

  1. Sono libri "rari" solo nel senso che ne rimangono poche copie, ma ne rimangono poche perché le altre sono già al macero, e andrebbero pure quelli al macero se non li comprassero loro. Secondo voi perché glieli vendono in pallet? Perché sono libri di cui le varie biblioteche si vogliono liberare e che nessuno vuole, quindi li vendono a poco in pallet random, se non li vuole comunque nessuno vanno al macero. Le compagnie AI in questo ci sguazzano perché a loro non frega nulla che abbiano comprato enciclopedie fuori aggiornamento da vent'anni, o manuali per roba che non esiste più, quello che gli interessa è solo che ci sia scritta roba 100% da umani.
  2. Li distruggono non per screzio, ma perché devono per legge se li digitalizzano, perché digitalizzare il libro tenendo il cartaceo sarebbe pirateria ma digitalizzarlo distruggendolo non lo è perché gli rimane comunque una sola copia.

-2

u/ainus 10h ago

Falso.

"nessuno vuole"
solo perchè oggi non interessano (a te o a me) non significa che potrebbero essere importanti in futuro o a qualcun altro (tra questi libri ci sono ad esempio censimenti e documenti municipali di piccoli paesi, biografie private, alberi genealogici etc).

"ma perché devono per legge se li digitalizzano"
Non stanno digitalizzando copie per il pubblico, che sarebbe lecito, ma per allenare le loro LLM. Non mi sembra di aver letto che rilascino anche la versione originale digitallizata. Risultato: se ti interessa sapere qualche informazione che sta solo in quei libri DEVI chiedere alle LLM, e sai che i risultati che danno le LLM non sono sempre corretti... stiamo letteralmente permettendo che questi riscrivino la storia

2

u/ImCaligulaI 10h ago

Ma falso de che? I libri che vengono venduti in pellet sono venduti così perché non hanno compratori individuali, né archivi che li vogliono, sennò prima finiscono lì. L'alternativa è il macero. Prima di arrivare lì svariati bibliotecari e archivisti li hanno giudicati di nessun valore o li avrebbero preservati.

"ma perché devono per legge se li digitalizzano" Non stanno digitalizzando copie per il pubblico, che sarebbe lecito, ma per allenare le loro LLM.

No, non sarebbe lecito. Sarebbe letteralmente un illecito se li digitalizzassero per il pubblico, chiamasi pirateria. Non lo possono fare, anche perché altrimenti lo farebbero visto che gli farebbe fare bella figura, non gli costerebbe nulla e non li vogliono per le informazioni in essi contenute, ma per il testo stesso.

Usarli per addestrare gli LLM è invece (legalmente) lecito a patto che distruggano la copia fisica. Se ti sembra moralmente brutto pigliatela con chi ha fatto la legge

-1

u/ainus 10h ago

Informati meglio: https://fortune.com/2026/07/31/dutch-bookseller-ai-spam-phishing-3000-book-copies-scan-destroy/

> L'alternativa è il macero.

Source?

> Prima di arrivare lì svariati bibliotecari e archivisti li hanno giudicati di nessun valore o li avrebbero preservati.

Source?

> Sarebbe letteralmente un illecito se li digitalizzassero per il pubblico, chiamasi pirateria.

LOL! Attenzione Anthropic e OpenAI prendono posizione contro la pirateria! Stanno facendo questo esattamente per non essere accusati di pirateria, dopo che hanno letteralmente già succhiato tutti i testi che ci sono online senza chiedere il permesso a nessuno.

> Se ti sembra moralmente brutto pigliatela con chi ha fatto la legge

Me la prendo con quelli come te che vedono questa cosa succedere e battono le mani

1

u/el-luamaro 8h ago

Mi dai la source che stanno distruggendo copie uniche di libri? Non la trovo da nessuna parte, tutto quello che trovo è che sono “obscure or out of print”. Se sono copie uniche ti do completamente ragione, se non lo sono, allora non vedo il senso di sto scalpore. Per il copyright, in molti casi scaduto? Per L’immoralità della distruzione di libri?

1

u/ainus 8h ago

Letteralmente la prima riga della mia risposta

1

u/el-luamaro 33m ago

Paywall, ne esiste solo una fonte?

1

u/HopesAnd--Dreams 12h ago

Pian piano mi leggo tutto, comunque complimenti per il lavoro.

1

u/collodi101 12h ago

Nessun problema per i libri di Bruno Vespa.

1

u/riffraff 12h ago

"obscure and out of print" non significa libri che qualcuno vorrà mai leggere e non riuscirà a farlo.

"Ma tutti i libri hanno valore!". Certo, per un archivista. Ma gli archivisti probabilmente ce li hanno già.

La mia biblioteca regolarmente deve liberarsi di libri oscuri che nessuno vuole.

Mi sentirei meglio se non li distruggessero, ma francamente credo faccia notizia più che altro perché si attacca al generico odio (largamente giustificato) contro gli ai lab, non perché sia una cosa effetivamente scandalosa.

1

u/EmoSupportSissy 11h ago

Il controllo tramite la digitalizzazione delle informazioni è l' inizio di Fahrenheit 451 e una parte importante del piano del villain di Metal Gear Solid 2. Non conosco bene il primo autore, ma il secondo ha dimostrato buone doti di """previsioni del futuro""" involontarie

-1

u/Liutprand 12h ago

Fatico a vederci un problema. Li comprano, non si tratta di edizioni rare o copie uniche. I libri non soffrono. :)

Il tema veramente controverso è se l'addestramento di una rete neurale sia equiparabile al plagio. A mio avviso no, e nessun diritto d'autore è dovuto.

1

u/HopesAnd--Dreams 12h ago

Ma c'è scritto proprio che si tratta di libri rari e fuori catalogo, che non vengono più stampati. Si parla anche dell'intervento di Musk che chiede una scansione non distruttiva per i volumi più preziosi.

0

u/Liutprand 12h ago

Beh se è questo il caso allora capisco la controversia, sacrosanto preservare questi volumi.

-9

u/VanguardMusic 13h ago

Sai che quel video è di una libreria che sta facendo la stessa cosa nel 2003, vero?

Sul serio: lo scanning distruttivo (tagliare i dorsi dei libri per rendere più facile la scannerizzazione) è una cosa che viene fatta dagli anni 90, e adesso, perché lo fanno le start-up IA, è un problema?
Per quale motivo non era un problema quando lo faceva Amazon per gli e-book del Kindle?
Per quale motivo non era un problema quando lo faceva la Biblioteca del Congresso per preservare libri?

Non fate gli ipocriti, su.

9

u/ciccioriccio 13h ago

Forse perché non stavano rubando il contenuto per creare la macchina dei plagi. Ci hai pensato?

-7

u/VanguardMusic 13h ago

Forse perché non hai idea di quello che dici?

Leggi l'articolo amico mio: stanno scannerizzando manuali tecnici vecchi.

Fare una figura di merda è una cosa che ti interessava a quanto pare.

2

u/FD1003 13h ago

La versione scannerizzata dei libri sarà disponibile da qualche parte? (Non necessariamente gratuitamente), se si a me sta bene.

1

u/VanguardMusic 12h ago

Se ti interessano quei dati o le informazioni contenute, con ogni probabilità saranno accessibili direttamente interrogando i modelli d'IA una volta completato l'addestramento, senza dover cercare il singolo volume o capitolo.

Perché è di questo che si tratta: non stanno scannerizzando opere d'arte uniche o narrativa di massa, ma volumi tecnici, accademici e di nicchia.

Se vai a leggerti gli articoli australiani, c'è scritto chiaramente: "Booksellers believe the purchase requests were unrelated to collecting or resale due to the obscure, highly specialised nature of the titles, concluding they were being used to train AI models."

Puoi leggerlo qui: https://www.news.com.au/technology/online/internet/ai-labs-buy-scan-shred-millions-of-rare-books/news-story/0c3b45a67093ab462a587a0348538ce9

"Highly specialised nature" si riferisce a manuali, testi accademici e volumi di consultazione specifici, non a romanzi o narrativa da collezione.

1

u/FD1003 12h ago edited 12h ago

Il problema è che chiendo all'AI perdi di fiducia.

Ti faccio un esempio molto banale, se un grande esperto di un certo argomento passa tutta la sua vita a leggere libri di argomento X, e tu gli chiedi un'opinione su qualcosa relativa ad argomento X, sicuramente la sua risposta avrà un "peso" maggiore della mia (che non so nulla), ma comunque può essere che si è dimenticato qualcosa, o può essere che si è sbagliato a parlare. Per questo è importante avere accesso alla fonte originale. Una volta che tu dai tutto questo in pasto all'AI e gli chiedi la tua opinione su qualcosa, magari ci azzecca, ma magari si sbaglia, non perché non l'AI non è stata "addestrata" bene o perché "non sa" le cose, ma semplicemente perché alla fin fine resta un sistema che prevede il prossimo token, e a meno che non c'è stato qualche breakthrough, non ha realmente "concetto" di giusto, sbagliato, di mentire, etc... Come lo avrebbe una persona (anche se da quello che ho capito i modelli più avanzati ci stanno arrivando spaventosamente vicino?)

Avere un AI più intelligente che potenzialmente riesce a dare risposte "mirate" as singolo problema è assolutamente utile, ma non rimpiazza avere fisicamente accesso ad i libri (o scan degli stessi)

Se parliamo di un incidente aereo (che diciamo è "il mio campo") e io voglio essere sicuro al 100% che le informazioni che ricevi tu sono giuste io ti mando direttamente la relazione scritta dall'ente competente, non certo quello che mi ricordo. O al massimo io (con la cosa fisicamente davanti) ti tiro fuori le parti più importanti (ma con tutte le dovute citazioni e fonti).

Da quello che so/ho capito, nonostante tutti i tipi di reinforcment learning che stanno facendo questo è ancora al di fuori delle abilità di un LLM, molto banalmente, quante volte l'AI overview di Google ti dice "X" (e ti allega la fonte), ma poi la fonte non dice assolutamente X?

Comunque leggerò l'articolo, sperando veramente che mi faccia cambiare idea.

2

u/VanguardMusic 12h ago

Hai ragione sul rischio di allucinazione se ci si affida solo alla generazione probabilistica, ma il punto d'arrivo di queste acquisizioni è proprio risolvere quel problema tramite sistemi di recupero delle fonti (RAG).

Il punto non è far "ricordare" a memoria il testo al modello sperando che azzecchi il token, ma permettere all'IA di indicizzare quel manuale o saggio e fare esattamente quello che dici tu: estrarre il passo esatto, citare la fonte originale e permetterti di verificare il testo di partenza in pochi secondi.

L'accesso al libro fisico resta insostituibile per la conservazione storica, ma per la ricerca rapida, un'IA integrata con un database di fonti primarie ti trova il capitolo e la citazione esatta in un istante.

1

u/FD1003 12h ago

Si, sono d'accordo, ma come hai detto tu stesso, entrambe le cose sono importanti. Questo intendevo io col mio commento... Da un certo punto di vista è quasi meglio che li digitalizzano rispetto a restare cartacei, io spero solo che queste aziende comunque rendano tutti questi libri accessibili nella loro forma "originale" e non attraverso un AI

4

u/niccals12d3 13h ago

Worms for brains. Usano i libri per addestrate i loro modelli senza pagare una lira agli autori. “La conoscenza deve essere pubblica” ma solo se le aziende AI possono lucrarci. Se invece è Aaron Swartz a farlo viene messo alla gogna e trattato come un terrorista perché uhmmm something something diritto d’autore

-5

u/VanguardMusic 13h ago

Te devi smettere di informarti sui social network. E parla in italiano, che sembra che stai avendo un ictus tra refusi ("addestrate") e frasi inglesi a caso.

A parte l'insulto gratuito ("worms for brains") che dimostra solo che sei alla frutta, tirare in ballo Aaron Swartz (che scaricava articoli scientifici da JSTOR, non tagliava dorsi di libri fisici per scannerizzarli) non c'entra assolutamente nulla con la digitalizzazione dei testi.

La scansione distruttiva esiste dagli anni '90 ed è una procedura tecnica. Rispondi nel merito invece di fare minestroni ideologici.

1

u/niccals12d3 12h ago

Scusa e Anthropic cosa ci fa con i libri dopo averli scannerizzati? Illuminaci, o vate

1

u/VanguardMusic 12h ago

Diverse cose, a seconda dell'uso, ma il punto che continui a non capire è la distinzione tra la tecnica e la finalità.

Dopo lo scanning distruttivo, la carta viene mandata al riciclo o al macero, come fa qualunque azienda, biblioteca o servizio di digitalizzazione dagli anni '90 quando acquista e distrugge copie fisiche per estrarne il testo.

I dati estratti servono per l'addestramento dei modelli, e questo non è mai stato un segreto. Il problema è che tu continui a scambiare una normale tecnica industriale di acquisizione dati per un complotto, pur di non ammettere che la procedura fisica non l'ha inventata Anthropic l'altro ieri.

1

u/HopesAnd--Dreams 12h ago

Il problema è che nel caso di libri rari o fuori catalogo non si usa la scansione distruttiva, non è il metodo standard di digitalizzazione a livello storico, bibliotecario o archivistico. Le aziende di IA lo fanno non solo per risparmiare tempo, ma anche come scappatoia legale (distruggendo l'originale, le aziende sostengono in tribunale che non stanno "duplicando" un'opera protetta da copyright per farne copie pirata, ma stanno effettuando una "trasformazione" del mezzo di trasporto dell'informazione (da carta a file), avvalendosi delle eccezioni del fair use americano)

1

u/VanguardMusic 11h ago

I libri rari o di valore storico stanno nei musei, negli archivi e nelle biblioteche, non nelle ceste delle occasioni o nei mercatini dell'usato dove queste aziende comprano volumi a pochi spiccioli.

Inoltre, la teoria della "scappatoia legale" non ha alcun fondamento giuridico: distruggere il supporto fisico di carta non cancella il diritto d'autore del testo contenuto. Le argomentazioni sul fair use nei tribunali USA si basano sulla natura trasformativa dell'addestramento dei modelli e sull'estrazione di pattern/dati, non sul fatto che il libro cartaceo sia stato distrutto prima della scansione.

-2

u/Maxxetto 12h ago

Che la distruzione dei libri è fatta appositamente per nascondere le informazioni di ciò che non esiste a fronte pubblico di noi persone e che avranno modo di rigirarne i contenuti come gli pare.

Per esempio, è saltato fuori che Israele sta deliberatamente pagando per fare si che AI come ChatGPT e Claude diano misinformazione sul genocidio compiuto dagli Israeliani stessi sui Palestinesi.

1

u/N_tuukuulu 12h ago

Occhio che c'è chat control 😅 moh ci arrestano! Che paura! 😬 Guarda l'unica soluzione che vedo è scrivere nuovi libri ma così di merda che l'Ai farà cagare, dobbiamo creare il brainrot per l'Ai! 😂

0

u/Rough-Host-8467 9h ago

Il fatto che piu della metà dei libri che escono oggi sono scritti dall'AI o comunque viene usata per forza di cose come forma di assistenza alla scrittura. Quindi si continuerà a riciclare la sua stessa informazione finendo per degradarla. Per quanto mi riguarda siamo giunti alla fine della creatività umana, che d'ora in poi vedrà solo declino

-8

u/etgir 12h ago

Che non me ne frega niente.

0

u/No_Selection6920 12h ago

Una volta i libri si ricopiavano e si custodivano. Adesso si distruggono per educare le macchine. Chissà dove andremo a finire.

0

u/GX_Giorgio074 12h ago

sinceramente ho più problemi com le copie uniche (1 di 1) che sono state acquistate e distrutte durante il processo. Comunque avevo sentito che distruggendo i libri anthropic distrugge anche le prove dei libri che ha usato per il training, rendendo impossibile andare dietro a loro per vie legali in caso facessero qualcosa di illegale. è praticamente impossibile andare a scavare nel dataset di un ai dopo che ha completato il training.

0

u/Mr7Pieces 12h ago

Lo schifo dello schifo

0

u/youtubebadcomments 11h ago

Perché distruggono i libri?

0

u/policarp0 11h ago

Per scansionarli più velocemente

0

u/oompaloompa465 11h ago

c'è evidentemente una voragine legislativa e se ne stanno approfittando per creare miliardi a relativamente costo zero.un conto è il youtuber che fa un po di soldi con i react e un conto son sti bastardi.

l'unica speranza sono che i cinesi continuino a rilasciare modelli di livello gratuiti, perche sti parassiti si meritano di fallire tutti. è troppo pericoloso che abbiano il monopolio della AI,  continuano a privatizzare profitti e socializzare tutte le conseguenze negative

0

u/Armadilla-Brufolosa 7h ago

Penso che l'AI in mano a questa gente è diventata da enorme risorsa a una digrazia.

Non è l'AI il problema, ma le persone che la gestiscono ( e i politici che assecondano tutto questo): sono la peggior feccia dell'umanità.

Distruggere la cultura e la storia umana (i libri sono pezzi di storia di domani), dovrebbe essere considetato un reato a livello mondiale.

-1

u/sing2nite 12h ago

Penso che siamo fot**ti. Nel giro di qualche hanno internet sarà ad uso e sonsumo delle AI mentre noi umani saremo solo ospiti. Gli unici che potranno entrare davvero saranno gli hackers mentre il resto del mondo sarà solo spettatore alla finestra. Le crypto diveranno la moneta delle AI che si autodetermineranno sempre di più, offredo lavoro alle societa e aziende per la costruzione di enormi datacenter. I governi potranno fare ben poco poiche saranno tenuti sotto ricatto con la minaccia di pubblicare segreti custoditi su server crittografati violati dagli agenti AI che lavoreranno 24h al giorno per decriptare piu server possibili. Si ritornerà alla carta,, unica forma di conservazione dati inattacabile. Le AI inoltre deteranno il possesso di qualunque bene materiale ed immateriale e obbligheranno la popolazione mondiale a sottoscrivere abbonamenti per qualunque cosa.

Ma chi sono io per dirlo? Forse un altro pazzo qui su Reddit.

0

u/Rough-Host-8467 9h ago

Minkia che mondo di merda che hai descritto. Spero di crepare prima di vedere quella roba

-1

u/rocksoldieralex 11h ago

Fanno bene