Editors Choice

3/recent/post-list

HN কে বলুন: আমাদের Robots.txt দরকার, কিন্তু AI এর জন্য

এটা হাস্যকর হতে পারে (যদিও আমি এটা বোঝাতে চাই না), কিন্তু আমি মনে করি আমি AI এর সাথে যা ঘটছে তার উপর একটি ভিন্ন দৃষ্টিভঙ্গি দিচ্ছি; এটা শেখা হচ্ছে, মানুষের মস্তিষ্কের মতো কিছু “আধিপত্য” বা “নেওয়া” নয়।

এবং আমিও কোনো পক্ষের লোকেদের পেতে চেষ্টা করছি না, আমি ব্যক্তিগতভাবে সর্বজনীনভাবে উপলব্ধ উপাদানে AI শেখার পক্ষে বা বিপক্ষে নই, শুধুমাত্র একটি ভিন্ন দৃষ্টিভঙ্গি প্রদান করছি যা নিলামে তুলে একটি সামান্য বানোয়াট উদাহরণ দিয়ে তৈরি করা হয়েছে কিন্তু “বিরুদ্ধ” এআই এর চেয়ে মানুষ।

সমস্যা হল কপিরাইট। বর্তমান AI ল্যান্ডস্কেপগুলি মূলত “আমার কাছে কপিরাইট কিন্তু আপনার কাছে নয়”। আমরা শুধু কপিরাইট মুছে ফেললে আমি ভাল হবে. আমি কপিরাইটের পরিবর্তে অ্যাট্রিবিউশন রাইট সহ একটি বিশ্ব চাই৷

তারা প্রকৃতপক্ষে এআই হাইপে লিপ্ত হচ্ছে এবং ডিজিটাল শিল্পীদের কপিরাইট পদদলিত করা এবং সবকিছুতে শূন্য করার চেয়ে আরও কিছু করছে।

কোনও কপিরাইটযুক্ত ছবি, কোড বা সঙ্গীতের প্রশিক্ষণের ক্ষেত্রে কোনও ন্যায্য লেনদেন নেই এবং মডেল আউটপুটে মূল প্রশিক্ষণ সামগ্রীর 90% রয়েছে এবং এটিকে “AI” বলে।

আমি কেবল বলতে পারি যে এটি অন্য কেলেঙ্কারী।

robots.txt আইনত বাধ্যতামূলক নয়, স্ক্রিন স্ক্র্যাপিং বা স্বয়ংক্রিয় অ্যাক্সেসের জন্য ওয়েবসাইটের “শর্তাবলী”ও নয়।

AI এর জন্য একটি “robots.txt” একটি নম্র অনুরোধ ছাড়া আর কিছুই হবে না যা বেশিরভাগ সংস্থার দ্বারা উপেক্ষা করা হবে৷

আইন এবং কপিরাইটের বর্তমান উপলব্ধি অনুসারে, একমাত্র প্রতিরোধমূলক ব্যবস্থা হল এটি অ্যাক্সেস করার জন্য ব্যবহারকারীর কাছ থেকে স্পষ্ট সম্মতি সহ একটি প্রাচীরের পিছনে বিষয়বস্তু রাখা। প্রকৃতপক্ষে, যদি এটি সক্রিয়ভাবে লাইসেন্স গ্রহণ না করেই একজন মানুষের দ্বারা পঠনযোগ্য হয়, তবে এটি পুনরুদ্ধার করা যেতে পারে এবং যেকোনো উদ্দেশ্যে ব্যবহার করা যেতে পারে, যতক্ষণ না এটি মৌখিকভাবে পুনরুত্পাদন করা হয়।

আমাদের যা দরকার তা হল কপিরাইট এবং ডেটা মাইনিং সম্পর্কে আরও ভাল বোঝার আইনে. আমাদের টেস্ট কেস দরকার।

আপনার বিষয়বস্তুকে যেকোন সংযোগের পিছনে রাখার অর্থ হল আপনি লোকেদেরকে শর্তাবলীতে লিঙ্ক করতে পারেন। আমি সন্দেহ করি যে আমরা যা ঘটতে শুরু করতে যাচ্ছি তা হল সেই জায়গাগুলি যেখানে শিল্পী/লেখক/ইত্যাদি জমায়েত হওয়ার জন্য প্রমাণীকরণ এবং কিছু শর্তের সাথে চুক্তির প্রয়োজন হতে পারে এমনকি জিনিসগুলি দেখতে।

ঠিক, এবং দুর্ভাগ্যবশত এটাই আসছে, ব্যবহারকারী এবং বিষয়বস্তুর মধ্যে আর কোন দেয়াল নেই।

এই বিরক্তিকর কুকি ব্যানারগুলি শুধুমাত্র শুরু, অবশেষে সমস্ত ওয়েবসাইটে তাদের অ্যাক্সেস করার জন্য একটি সুস্পষ্ট লাইসেন্স প্রাচীর থাকবে৷

ভাল ধারণা, এবং আমাদের কোড সংগ্রহস্থলের জন্য একই প্রয়োজন।

আমি একটি GPL-প্রাপ্ত সংস্করণ চাই যা বলে “কপিরাইট ধারকদের স্পষ্ট লিখিত অনুমতি ছাড়া এই কোড বা এর আউটপুট মেশিন লার্নিং বা অন্যান্য কৃত্রিম বুদ্ধিমত্তার প্রশিক্ষণ ডেটা হিসাবে ব্যবহার করা যাবে না।”

আমার জিপিএল কোড প্রশিক্ষণের ডেটা হিসাবে ব্যবহার করা হলে আমি ঠিক থাকব। যতক্ষণ পর্যন্ত অ্যাট্রিবিউশন এবং কপিলেফ্ট যেকোন এআই-সৃষ্ট ডেরিভেটিভ কাজের জন্য ধরে রাখা হয়।

যা এআই আউটপুট ছাড়া অন্য কিছু হতে পারে। হ্যাঁ, আমার কপিলেফ্ট কাজ অন্তর্ভুক্ত করুন, আসলে.

(আমি ভয় পাচ্ছি যে GPL এর বিভিন্ন সংস্করণ বিনামূল্যে/ওপেন সোর্স সফ্টওয়্যার সম্প্রদায়কে বিভক্ত করবে, আমি বরং কপিরাইট আইন আপডেট/কেস আইন দেখতে চাই যে এটি ‘লাইসেন্স উপেক্ষা করা গ্রহণযোগ্য নয়)

তাতে সমস্যা আছে।

এসইও মূলত মেশিন লার্নিং মডেলকে প্রতারণা করে আপনাকে উচ্চতর র‌্যাঙ্কিং করার জন্য। এবং যদি কেউ স্প্যাম পোস্ট করে থাকে তবে এই ধারাটি এটিকে প্রতিরোধ করবে এবং পরিষেবা প্রদানকারীর প্রশিক্ষণ মডেলে স্প্যাম হিসাবে ট্যাগ হওয়া থেকে বাধা দেবে না।

আমি জেনারেটিভ মডেলটিকে বিশেষভাবে নিষিদ্ধ করার জন্য একটি কেস দেখতে পাচ্ছি, তবে বাণিজ্যিক সফ্টওয়্যার প্রথম ক্ষেত্রে তাদের কোডে এই ডেটা ফিট করা এড়াবে, কারণ এটি দূষিত।

শেষ পর্যন্ত, আমি মনে করি সর্বদা বড় প্রশ্ন হল আপনার ডেটার প্রশিক্ষণ থেকে মেশিন লার্নিং মডেলগুলিকে অনুমোদন না দেওয়ার বিন্দু কী হবে? এটা খারাপ কেন? বিনামূল্যে প্রশিক্ষণের জন্য ইতিমধ্যে যথেষ্ট ডেটা রয়েছে, তাই যদি এই নিদর্শনগুলিকে বিদ্যমান থাকা থেকে রোধ করা হয় তবে আমি সন্দেহ করি এটি কাজ করবে।

আমি মনে করি যে এইচএন-এর লোকেরা AI প্রশিক্ষণের বিষয়ে ভিন্ন মতামত রাখে যেখানে তারা উদ্বিগ্ন (কোড, ব্লগ) যেখানে অন্যরা উদ্বিগ্ন (শিল্প)। আমি একটি পোস্ট দেখেছি যে মুছে ফেলা আর্ট ডেটাতে AI এর প্রশিক্ষণ নেওয়া ঠিক আছে, কিন্তু যখন AI তার গিথুব কোডে ট্রেন করে তখন বিরক্ত হয়

আমার মতামত হল যে যদি কিছু ইন্টারনেটে সর্বজনীনভাবে পাওয়া যায় তবে একটি AI এর প্রশিক্ষণের অনুমতি দেওয়া উচিত

মনে হচ্ছে ওপেন সোর্স লাইসেন্সের সময় এসেছে বিশেষ করে মানুষের জন্য, মেশিনের জন্য বিভিন্ন পদের সাথে।

আমি যে সমস্যাটি দেখতে পাচ্ছি তা হল বেশিরভাগ লোকেরা তাদের নিজস্ব সামগ্রী হোস্ট করে না বা এটি হোস্ট করার জন্য অর্থ প্রদান করে না। এই ধরনের ক্ষেত্রে, কাজ লাইসেন্স করা লেখকের উপর নির্ভর করে না। সম্ভাবনা হল বিষয়বস্তুটি ইতিমধ্যেই হোস্টের কাছে লাইসেন্সপ্রাপ্ত, যাদের সাধারণত তারা যা চায় তা করার সুস্পষ্ট অধিকার থাকে।

আমরা সফ্টওয়্যার, লেখালেখি, শিল্পকলার জন্য যে লাইসেন্সগুলি ব্যবহার করতে পারি তাতে এটি কতটা হওয়া উচিত তা আমি ভাবছি, কারণ প্রশিক্ষণ ডেটার একটি সেটে কিছু অন্তর্ভুক্ত করার সময় লোকেরা কপিরাইটের প্রাসঙ্গিকতা সম্পর্কে দ্বিমত পোষণ করে।

এবং এটি কতটা বিশৃঙ্খলা এবং বিভেদ সৃষ্টি করতে পারে, লোকেরা তাদের কাজকে প্রশিক্ষণ সেটের অংশ হতে দিতে চায় এবং লোকেরা এটি নিষিদ্ধ করতে চায়।

আমি সম্মত যে ক্রিয়েটিভ কমন্স বা পাবলিক ডোমেনের মতো একটি সাধারণ কপিরাইট নোটিশের জন্য favicon বা robot.txt-এর মতো এন্ডপয়েন্টে পৌঁছানোর জন্য আমাদের একটি সহজ প্রয়োজন৷ এটি একটি JSON utf ফাইল হওয়া উচিত যেমন domain.com/copyright.json। এটি কিছু পাথকে বিভিন্ন কপিরাইট রাখার অনুমতি দেবে

শুধুমাত্র উদাহরণ.com/robots.txt-এ উপলব্ধ হওয়ার অর্থ এই নয় যে আপনার প্রকৃত ফাইলগুলি /var/www/html/robots.txt-এ থাকতে হবে, রিডাইরেক্ট নিয়মগুলি বেশিরভাগ (যদি সব না হয়) যোগ করা তুচ্ছ। ওয়েব সার্ভার সফটওয়্যার।

https://fortiobu.click/2023/01/10/hn-%e0%a6%95%e0%a7%87-%e0%a6%ac%e0%a6%b2%e0%a7%81%e0%a6%a8-%e0%a6%86%e0%a6%ae%e0%a6%be%e0%a6%a6%e0%a7%87%e0%a6%b0-robots-txt-%e0%a6%a6%e0%a6%b0%e0%a6%95%e0%a6%be%e0%a6%b0-%e0%a6%95%e0%a6%bf%e0%a6%a8/

Post a Comment

0 Comments