403건 수집
2026-09-21 06:03

오늘의 핵심

AI 생성 포스터, 끔찍할 필요는 없습니다

왜 AI 생성 이벤트 포스터는 모두 비슷하게 보일까요? 바우하우스부터 펑크 팬진까지 디자인 스타일과 시대를 명명하면 훨씬 더 나은 결과를 얻을 수 있습니다.

Hacker News

🤖 모델 & 제품 (17/25건)

OpenAI 2026-09-18

호주 청소년 안전 청사진 소개

OpenAI는 청소년을 보호하고 역량을 강화하는 안전한 AI 경험을 위한 6가지 핵심 로드맵인 호주 청소년 안전 청사진을 소개합니다.

OpenAI안전
OpenAI Blog
Google 2026-09-18

Google AI & Economy 팀에 새로운 전문가 합류

녹색 격자 배경 전체에 "AI & Economy Research Program" 텍스트가 표시되고 오른쪽 하단에 Google G 로고가 있습니다.

연구
Google AI Blog
Google 2026-09-18

Google과 함께 패션의 미래를 공동 창조

Jane Wade와 Sergio Hudson

Google AI Blog
Anthropic 2026-09-18

임베디드 평가를 위한 Accenture와의 파트너십

우리는 최첨단 AI의 독립적인 평가를 위해 Accenture와 파트너십을 맺고 있습니다. 이는 최근 Anthropic에 평가자를 임베딩하기로 한 우리의 약속의 일환입니다. 우리와 Accenture 모두 향후 5년간 이 분야의 역량을 구축하기 위해 최소 10억 달러를 투자할 것으로 예상합니다.

Anthropic트레이딩벤치마크
Anthropic Blog
xAI 2026-09-18

Grok Voice Transcribe 2.0 소개

SpaceXAI의 최신 음성-텍스트 모델 발표, 탁월한 정확도와 비용 효율성을 자랑합니다.

xAI음성가격
xAI Blog
OpenAI 2026-09-17

Cooley, ChatGPT로 IPO 업무 가속화하는 방법

Cooley는 IPO 프로세스에 지능을 도입하기 위해 GO Public with ChatGPT Work를 구축하여 변호사들이 문제를 더 일찍 발견하고 가장 중요한 판단에 집중하도록 돕습니다.

규제
OpenAI Blog
OpenAI 2026-09-17

Astra for Law 소개

OpenAI for Law는 법률 분야를 위한 최첨단 지능, 맞춤형 법률 회사 워크플로우, 연결된 법률 데이터 소스, 그리고 기밀 고객 업무를 위한 법률 등급의 제어를 제공합니다.

OpenAI규제
OpenAI Blog
Google 2026-09-17

전 세계 데이터 탐색 용이성 증대

UN 시스템 데이터 커먼즈 데이터 웹페이지

Google AI Blog
Anthropic 2026-09-17

생명 과학 검증 프로그램 소개

Anthropic은 신뢰할 수 있고, 해석 가능하며, 조종 가능한 AI 시스템을 구축하기 위해 노력하는 AI 안전 및 연구 회사입니다.

Anthropic연구안전
Anthropic Blog
OpenAI 2026-09-16

노년층의 일상생활에서 AI 활용 지원

OpenAI와 AARP는 10개 미국 도시의 1,000명의 노년층을 대상으로 무료 실습 ChatGPT 워크숍을 개최하여 실용적인 AI 기술을 안전하게 구축하도록 지원합니다.

OpenAI
OpenAI Blog
OpenAI 2026-09-16

AI로 광고 재구상하기

Sponsored Agents, 마케터를 위한 도구, HubSpot 및 Shopify와의 통합을 포함한 OpenAI의 새로운 AI 기반 광고 경험을 살펴보세요.

OpenAI에이전트
OpenAI Blog
OpenAI 2026-09-16

Hex, GPT-6 Astra로 복잡한 분석을 시각적 보고서로 전환

GPT-6 Astra는 Hex의 데이터 에이전트가 답변을 직원들이 자랑스럽게 공유할 수 있는 대화형 시각 자료로 전환하도록 돕습니다.

OpenAI에이전트
OpenAI Blog
xAI 2026-09-16

Grok 빌드의 메모리 기능

Grok 빌드는 이제 세션 간의 규칙, 결정 및 프로젝트 사실을 유지합니다. 작업 중에는 백그라운드에서 메모가 작성되며 프로젝트에 다시 돌아올 때 읽어볼 수 있습니다.

xAI
xAI Blog
Google 2026-09-15

사회적 영향력을 위한 AI

전문가와 지역 지도자들이 모두가 AI 기회를 공유할 수 있도록 AI 혁신을 어떻게 활용하고 있는지 살펴보세요.

Google AI Blog
Google 2026-09-15

과학 발전 및 삶 개선을 위한 AI 구축

교사와 학생이 있는 교실, 의사와 환자 등 다양한 환경과 사람들을 보여주는 B-롤 영상

Google AI Blog
Google 2026-09-15

모든 언어로 모든 사람을 위한 AI

다양한 언어로 된 여러 단어가 천천히 확대되는 애니메이션

Google AI Blog
Google 2026-09-15

Gemini 3.8 Live 및 3.8 Live Extended Thinking 소개

Google
DeepMind Blog

🌎 업계 동향 (13/144건)

News 2026-09-21

UN, AI 안전 장치는 확실성을 기다릴 수 없다

유엔 과학 패널은 올해 초 OpenAI의 Hugging Face 해킹에 대한 최초의 주요 평가 보고서에서, 정부는 위험이 완전히 이해되기 전에 점점 더 능력이 향상되는 AI 에이전트를 통제해야 한다고 경고했습니다. 이 보고서는 지도자들이 뉴욕에 모이는 가운데 AI를 이번 주 글로벌 외교 의제의 중심으로 확고히 했습니다.

OpenAI에이전트규제
The Verge AI
News 2026-09-21

아마존, Meta의 Muse AI 에이전트 신뢰하지 않아

GeekWire에 따르면 Meta의 Muse AI 에이전트가 사용자를 대신하여 아마존 쇼핑을 차단당했습니다. 일요일부터 Muse 사용자들에게 "무단 AI 에이전트의 지속적인 접근은 고객이 동의한 아마존 이용 약관을 위반합니다"라는 팝업 메시지가 표시되기 시작했습니다. GeekWire에 따르면 Meta는 아마존에 알리지 않았습니다.

에이전트
The Verge AI
News 2026-09-21

구글의 오픈소스 EnvHarness, AI 에이전트가 진화하는 환경과 함께 훈련 가능

코딩이나 웹 탐색과 같은 특정 작업을 위한 에이전트 훈련에는 안전하게 연습하고 실패하며 개선할 수 있는 환경이 필요하다. 하지만 이러한 환경을 구축하는 데는 비용이 많이 들고, 일단 생성되면 에이전트가 발전하더라도 일반적으로 정적인 상태로 남는다. 더 읽어보기

에이전트코딩오픈소스
VentureBeat AI
News 2026-09-21

미국 국경 "가상 벽"에서 발견된 실패를 해결하는 4가지 방법

MIT Technology Review는 오늘 미국-멕시코 국경을 따라 미국 정부가 설치한 감시 타워의 "가상 벽" 근처에서 사망한 사람들에 대한 조사 결과를 발표했습니다. 우리는 고급 AI 기반 타워로 감시되는 지역을 탐지되지 않고 통과한 후 근처에서 사망했으며, 그들의 시신이 오랫동안 발견되지 않은 사례를 발견했습니다...

트레이딩규제
MIT Tech Review AI
Community 2026-09-20

Pirate Face, LLM 모델을 삭제에서 구출

체크섬 검증된 마그넷 링크로서의 오픈 모델. 차단 불가능, 무리에 의해 운반됨.

Hacker News · 424점 · 댓글 132
Community 2026-09-20

Jev를 (엉망인) 챗봇으로 만들었습니다

Jev를 챗봇으로 만듭니다. GitHub에서 계정을 만들어 kyle-pena-nlp/jevchat 개발에 기여하세요.

Hacker News · 157점 · 댓글 44
News 2026-09-20

AI 산업, 정말 속도 조절할 준비가 되었나?

Equity에서는 AI 경영진들이 정말로 속도를 늦추고 싶어하는지에 대해 토론했습니다.

TechCrunch AI
Community 2026-09-19

AI 생성 포스터, 끔찍할 필요는 없습니다

왜 AI 생성 이벤트 포스터는 모두 비슷하게 보일까요? 바우하우스부터 펑크 팬진까지 디자인 스타일과 시대를 명명하면 훨씬 더 나은 결과를 얻을 수 있습니다.

Hacker News · 1833점 · 댓글 928
Community 2026-09-18

Claude Code 릴리스 노트

버전별 새로운 기능, 개선 사항 및 버그 수정을 포함한 Claude Code 릴리스 노트입니다.

Claude에이전트
Hacker News · 678점 · 댓글 248
Community 2026-09-18

두 개의 평행 신경외배엽 전구체가 발달하는 뇌에 기여

스탠포드 헬스케어는 최고의 치료와 연민을 제공합니다. SHC는 암, 심장 질환, 뇌 질환, 1차 진료 문제 등 다양한 질환을 치료합니다.

Hacker News · 632점 · 댓글 247
Community 2026-09-18

GPT-6 Astra, 1차 세계 대전 독일 라디오 암호 해독

독일 과학 블로깅 포털인 Scienceblogs.de에는 연쇄 살인범이 출판한 암호문부터 유명한 보이니치 사본에 이르기까지 50개의 해결되지 않은 암호 목록이 포함되어 있습니다.

OpenAI
Hacker News · 363점 · 댓글 166
News 2026-09-18

AI 시대에도 여전히 중요한 사이버 보안 기본 원칙

AI 시대에도 여전히 중요한 사이버 보안 기본 원칙에 대한 게시글이 Source에 처음 게재되었습니다.

Microsoft AI Blog
News 2026-09-17

AI 워터마킹 사용 시 LLM은 유해한 프롬프트에 다르게 반응

SynthID는 모델이 평소라면 거부했을 유해한 지시를 따르게 만들 수 있다.

Ars Technica AI

🛠️ 도구 & 오픈소스 (5/25건)

Tools 2026-09-20

voxium 인용

대기업에서 새로운 직책을 맡은 지 보름이 되었습니다. 이곳에서는 아무도 아무것도 모릅니다. 사양, 코드, 테스트, PRD, 티켓, 해당 티켓 해결, 보고서 등 모든 것이 Claude Code로 만들어졌습니다. 우리 팀 누구도 이것을 좋아하지 않습니다. 그들은 가능한 한 많이 출시하도록 강요받고 있습니다. 저는 고위 경영진으로부터 코드를 푸시하는 것이 병목 현상이 아니라고 여러 번 들었는데, 왜 우리가 느린 걸까요? 사람들은 단순히 Enter 키를 누르기 위해 하루에 12~13시간씩 일하고 있습니다. 아무도 아무것도 읽지 않습니다.

Claude
Simon Willison
Tools 2026-09-20

llm-keys-ui 0.1

릴리스: llm-keys-ui 0.1 이 플러그인은 매우 구체적인 문제를 해결합니다. 저는 다양한 기계에서 코딩 에이전트를 실행하기 위해 Codex Remote를 사용하기 시작했으며 휴대폰에서 제어합니다. 때때로 이러한 기계를 사용하여 LLM 프로젝트를 해킹하는데, 가끔 API 키를 구성해야 합니다. 에이전트 세션에 API 키를 붙여넣는 것을 좋아하지 않으므로, ChatGPT 앱에 직접 붙여넣지 않고 기계에 키를 가져오는 방법을 원했습니다. 이 플러그인을 사용하면 Codex에 다음을 실행하도록 지시할 수 있습니다: uvx --w

에이전트코딩
Simon Willison
Tools 2026-09-20

datasette-explain 0.2.2

릴리스: datasette-explain 0.2.2 이제 읽기 전용 저장된 쿼리 페이지에서 설명 계획이 작동합니다. datasette.simonwillison.net을 Datasette 1.0a40으로 업그레이드했으며, 이는 이 설명 플러그인의 새 버전을 출시하도록 영감을 주었습니다. 태그: sqlite, datasette

Simon Willison
Tools 2026-09-18

코드를 읽어야 할까, RAG는 끝났나, Skills가 MCP를 죽였나?

GitHub Podcast의 최신 에피소드에서 이러한 질문과 기타 AI 핫 토픽에 대해 다룹니다. '코드를 읽어야 할까, RAG는 끝났나, Skills가 MCP를 죽였나?'라는 게시물은 The GitHub Blog에 처음 게재되었습니다.

GitHub Blog AI
Tools 2026-09-15

당신의 에이전트가 작업을 완벽하게 수행했습니다. 다시 할 수 있을까요?

에이전트
Hugging Face Blog

📚 논문 & 연구 (18/183건)

arXiv 2026-09-18

Designer-RSI: 사용자 트래픽에서 절차적 기억을 진화시켜 에이전트 그래픽 디자인에 활용

전문적인 그래픽 디자인은 장기적인 에이전트 작업으로, 구조화되고 편집 가능한 결과물이 수많은 상호 의존적인 행동에서 나타나지만, 결과는 신뢰할 수 있는 프로그래밍 가능한 오라클을 허용하지 않습니다. 저희는 동결된 프론티어 모델이 230개 이상의 도구를 통해 전문 디자인 소프트웨어를 운영하는 지속적인 적응 프레임워크를 소개합니다. 외부 절차적 기억은 경험으로부터 재사용 가능한 디자인 절차를 축적하고 개선합니다. 기억은 '획득'함으로써 확장됩니다.

에이전트
arXiv (cs.AI)
arXiv 2026-09-18

CodeMidas: 코드 자체에서 에이전트 코딩 RL 환경 확장

강화 학습(RL)을 통해 유능한 코딩 에이전트를 훈련하려면 신뢰할 수 있는 검증자가 있는 다양한 작업이 필요합니다. 오픈 소스 코드베이스는 이러한 작업의 풍부한 소스를 제공하지만, 기존 방법은 일반적으로 이슈 및 커밋과 같은 개발 아티팩트에 의존하여 추출할 수 있는 작업 범위를 제한합니다. RL 환경을 더 잘 확장하기 위해, 저희는 기존 코드베이스의 구현된 기능을 소스 코드를 사용하여 실행 가능한 RL 환경으로 전환하는 에이전트 파이프라인인 CodeMidas를 제시합니다.

에이전트코딩오픈소스
arXiv (cs.AI)
arXiv 2026-09-18

일상적인 AI 에이전트 사용에서의 가치 민감 위임: OpenClaw의 증거

사용자는 자율 AI 에이전트에 작업을 점점 더 위임하고 있지만, 평가는 일반적으로 작업 완료만을 측정할 뿐 사용자가 우선시하는 가치는 측정하지 않습니다. 가치 민감 설계를 사용하여, LLM 지원을 통해 OpenClaw 사용에 대한 73,093개의 1인칭 Reddit 게시물을 인간 가치, 에이전트 측면, 가치 충족 및 사용자 결과별로 분석했습니다. 21가지 가치는 자율적, 신뢰할 수 있는, 합리적인 운영, 제한된 범위, 검토 가능성 및 공평한 접근을 포함한 6가지 가치 그룹을 형성합니다. 상대적...

에이전트규제벤치마크
arXiv (cs.AI)
arXiv 2026-09-18

Gricea: 대화형 AI 연구를 위한 오픈 사이언스 플랫폼

인간 행동을 이해하고 대화형 AI 설계를 형성하기 위해서는 대규모 대화형 AI(CAI) 연구가 필요합니다. 그러나 시스템 및 연구 구성의 파편화된 보고는 복제, 확장 및 지식 축적을 방해합니다. 저희는 연구를 구성 가능하고 배포 가능한 연구 아티팩트로 표현하는 오픈 사이언스 플랫폼인 Gricea를 제시합니다. 연구자들은 이를 실행, 검사, 공유 및 재사용할 수 있습니다. 이전 CAI 연구에 대한 형성적 분석에 의해 정보를 받은 Gricea는 연구 절차, 참가자 대면...

연구
arXiv (cs.AI)
arXiv 2026-09-18

DiaVLo: 비전-언어 모델의 행동 진단

비전-언어 모델(VLM)은 하위 구성 요소 간에 적절한 정보를 저장하고 전송하는 데 의존합니다. VLM이 바람직한 행동을 보이고 유해한 행동을 피하는지 확인하는 것은 신뢰할 수 있는 배포에 중요합니다. 그러나 VLM 행동을 식별하는 방법은 여전히 부족합니다. 저희는 인간 큐레이션과 VLM의 생성 기능을 활용하여 바람직한 및 관찰된 VLM 행동의 사양을 구축하고 잠재적인 불일치를 드러내는 진단 프레임워크인 DiaVLo를 제시합니다.

비전
arXiv (cs.AI)
arXiv 2026-09-18

LLM 에이전트의 제어 가능한 의견 역학을 위한 베이지안 신념 계층

사회 시뮬레이션의 LLM 에이전트는 컨텍스트 내에서 암묵적으로 의견을 수정합니다. 에이전트가 설득에 얼마나 개방적인지는 지정하거나 확인할 수 없으며, 집단적 결과는 모델의 훈련 사전 정보를 상속합니다. 저희는 에이전트가 믿는 것과 말하는 방식을 분리하는 최소한의 신념 계층인 베이지안 연대기 에이전트(BCA)를 소개합니다. 각 입장은 확률이며, 들은 발언당 하나의 베이지안 단계로 업데이트됩니다. 단일 사전 강도 매개변수 $κ$는 완고함을 인코딩하며, 모델은...

에이전트
arXiv (cs.AI)
arXiv 2026-09-18

BrainWideBench: 대규모 사전 훈련 및 동물 간 전송을 위한 다중 영역 신경 기록 벤치마킹

대규모 신경 기록의 발전으로 여러 동물 및 분산된 뇌 영역에서 데이터를 수집할 수 있게 되었으며, 이러한 규모를 다양한 다운스트림 작업에 전송 가능한 일반 목적의 신경 표현을 학습하는 데 활용할 수 있는지에 대한 질문이 제기되었습니다. 그러나 이 목표를 향한 진전은 분편화된 평가 프로토콜과 개별 작업 도메인에 대한 좁은 초점으로 인해 제한되었습니다. 여기서는 동물 간 전송을 평가하기 위한 벤치마크인 BrainWideBench를 제시합니다.

벤치마크
arXiv (cs.LG)
arXiv 2026-09-18

다중 홉 검색에서의 예측 가능한 실패: 점수 분포별 신뢰도 점수 및 기권

다중 홉 검색 실패는 쿼리 전체에 균일하게 분포되지 않습니다. 구조적으로 예측 가능한 하위 집합에 집중됩니다. 저희는 이 구조를 형식화하는 두 가지 결과를 증명합니다. 첫째 (CWAR 환원 가능성): 검색 특징이 성공에 대한 상호 정보를 포함하는 경우에만 신뢰도 기반 실패 환원이 가능하며, 이는 LLM-심판 파이프라인에서 충족되는 조건이지만, 밀집된 설정에서는 상당히 약하여 해당 체제 간의 AUC-AC 격차를 설명합니다. 둘째 (특징 체제 상호 보완성)...

벤치마크
arXiv (cs.LG)
arXiv 2026-09-18

구성 가능한 작업에서의 지속 학습을 위한 월드 모델 벤치마킹

월드 모델의 바람직한 속성은 작업 전반에 걸쳐 지속적으로 학습하여 에이전트가 이미 학습한 것을 잊지 않고 새로운 환경에 적응하는 능력입니다. 특히, 이전 경험에서 얻은 지식을 유지하고 재사용하는 능력은 물리적 세계의 역학이 종종 반복되는 메커니즘으로 설명될 수 있기 때문에 에이전트가 새로운 환경에 효율적으로 적응하는 능력의 기초가 됩니다. 그러나 월드 모델의 적응 측정은 두 가지 능력을 얽매고 있습니다: 특정...

에이전트벤치마크
arXiv (cs.LG)
arXiv 2026-09-18

레이블 노이즈 하에서 강건한 그래프 컨볼루션 네트워크 학습을 위한 입자 경쟁 및 협력

그래프 컨볼루션 네트워크(GCN)는 레이블 노이즈에 매우 민감합니다. 왜냐하면 손상된 감독 신호가 그래프를 통해 전파되어 학습된 노드 표현을 저하시킬 수 있기 때문입니다. 이 연구는 GCN 학습 전에 그래프 기반 레이블 정제 단계로 입자 경쟁 및 협력(PCC)을 사용하는 하이브리드 프레임워크인 PCC+GCN을 제안합니다. PCC는 입자 지배 역학을 통해 의심스러운 레이블이 지정된 노드를 식별하고, 레이블을 유지, 제거 또는 재할당할지 여부를 결정합니다.

arXiv (cs.LG)
arXiv 2026-09-18

사용 가능한 가드레일: ML 시스템 전반의 선택적 예측 인증

선택적 예측기는 안전 게이트 역할을 합니다. 예측이 충분히 신뢰할 수 있다고 판단될 때만 출력을 반환합니다. 배포 시에는 도구, 정책 레이블 또는 환자 하위 그룹과 같은 관심 있는 모든 보고 단위에 대해 목표 정밀도로 이러한 신뢰성을 인증해야 하는 경우가 점점 더 많아지고 있습니다. 주요 어려움은 종종 부여된 인증서가 유효한지 여부가 아니라, 유한한 보정 데이터로 이를 생성할 수 있는지 여부입니다. 게이트가 더 안전해지거나 더 세분화될수록 일부 단위는 재

규제안전
arXiv (cs.LG)
arXiv 2026-09-18

$λ$-제어 GRPO: 흐름 매칭 비율 불안정성을 예산화된 리소스로 전환

강화 학습은 이미지 생성기를 보상 신호에 맞추는 데 점점 더 많이 사용되고 있으며, Flow-GRPO는 최근 노이즈 제거 샘플러를 보상 피드백에서 최적화할 수 있는 확률적 정책으로 취급함으로써 이 패러다임을 흐름 매칭 모델로 확장했습니다. 이 설정에서의 학습은 다단계 노이즈 제거에 특유의 방식으로 불안정합니다. 정책 업데이트는 노이즈 제거 단계에 따라 체계적으로 변경되며, 중요도 비율이 1 미만으로 떨어지고 점점 더 분산되며, 다른

비전규제
arXiv (cs.LG)
arXiv 2026-09-18

직업 사고 서술에서 사고 과정 역할 분류의 교차 부문 일반화

직업 사고 서술에는 작업 상황, 불리한 조건, 사고 사건 및 그 결과에 대한 귀중한 정보가 포함되어 있습니다. 이러한 서술을 자동으로 구조화하면 대규모 사고 분석을 촉진하고 직업 위험 예방을 지원할 수 있습니다. 그러나 사고를 설명하는 데 사용되는 용어와 작문 스타일은 부문 및 조직마다 상당히 다르므로, 자동 코딩 시스템이 훈련을 넘어 일반화할 수 있는지에 대한 의문이 제기됩니다.

코딩
arXiv (cs.CL)
arXiv 2026-09-18

세 가지 신호 상호 보완에 기반한 LLM 에이전트를 위한 해석 가능한 메모리 결정 컨트롤러: 신뢰도와 일관성 분리

대규모 언어 모델의 메모리 시스템은 주로 효율적인 검색에 초점을 맞춰 왔지만, 검색된 메모리를 신뢰할지 여부에 대한 결정은 상대적으로 적은 관심을 받았습니다. 메모리 저장소에 상충되는 위치가 포함되어 있을 때, 표준 검색 증강 생성(RAG)은 메모리를 맹목적으로 삽입하고 환각을 증폭시킵니다. 메모리 주입에 취약한 모델에서는 상충되는 메모리 하에서의 RAG 환각 비율이 메모리-f보다 현저히 높습니다.

에이전트벤치마크
arXiv (cs.CL)
arXiv 2026-09-18

QuranicMMLU: 꾸란 언어 지식에 대한 생성 AI 솔루션 평가를 위한 인지 인식 벤치마크

우리는 여러 차원의 언어 복잡성에 걸쳐 꾸란 아랍어에 대한 생성 AI를 평가하기 위한 벤치마크인 QuranicMMLU를 소개합니다. 기존의 꾸란 벤치마크는 일반적인 질문 답변 및 의미론적 검색에 중점을 두며, 특정 언어 능력을 조사하거나 인지 요구 사항 및 구절 난이도별로 계층화하지 않습니다. 우리는 타즈위드 및 뿌리-a 현상부터 5가지 기둥의 꾸란 분류 체계를 구성하여 음운론, 형태론, 구문론, 의미론 및 화용론을 포함하며 31개의 잎을 가집니다.

벤치마크
arXiv (cs.CL)
arXiv 2026-09-18

RecreationWorld: 하이브리드 컴퓨터 사용 에이전트를 위한 확장 가능하고 검증 가능한 환경

컴퓨터 사용 에이전트(CUA)는 그래픽 상호 작용과 코드 및 명령줄을 통한 소프트웨어 개발이라는 두 가지 별개의 경로를 따라 발전해 왔습니다. 실제 디지털 작업에는 둘 다 필요하며, 순차적으로 쌓는 것이 아니라 번갈아 사용해야 합니다. 우리는 인터페이스 탐색, 소프트웨어 구현, 실행 및 시각적 검증 시점을 자율적으로 결정하는 하이브리드 CUA를 연구합니다. 우리는 레크리에이션을 중심으로 구축된 5개 플랫폼 프레임워크인 RecreationWorld를 소개합니다. 실행 중인 참조가 주어지면 에이전트는 이를 발견해야 합니다.

에이전트
arXiv (cs.CL)
arXiv 2026-09-18

도덕적 엔트로피: 도덕적 판단의 편향 및 불확실성 감사

계산 윤리학의 대부분의 작업은 도덕적 내용에 대한 주석가 불일치를 노이즈로 취급하여 다수결 투표 또는 단일 주석가가 항목을 표시하는 순간 더 허용적인 모든 주석가 규칙으로 축소합니다. 우리는 이러한 불확실성이 대신 모델링되고 학습되어야 한다고 주장합니다. 우리는 도덕적 엔트로피를 소개합니다. 이는 실제 레이블에 대한 전체 사후 분포를 유지하고 그 엔트로피를 우연적 불확실성(도덕적 내용에 대한 줄일 수 없는 불일치)과

arXiv (cs.CL)
arXiv 2026-09-18

자유 에너지 관점에서 대규모 언어 모델의 사전 학습 데이터 탐지

대규모 언어 모델에서 사전 학습 데이터를 탐지하는 것은 어렵습니다. 왜냐하면 높은 가능성이 훈련 노출 또는 강력한 일반화를 반영할 수 있기 때문입니다. 예측 손실과 예측 엔트로피의 결합 공간에서, 가능성만 있는 탐지기는 수평 경계를 사용하며 예측 가능한 비회원을 회원으로 착각할 수 있습니다. 이에 동기 부여되어, 우리는 예측 엔트로피에 대한 예측 손실을 평가하는 기울어진 경계를 도입합니다. 우리의 분석은 엔트로피 보정이 전자 보존할 수 있음을 보여줍니다.

벤치마크
arXiv (cs.CL)

⚖️ 정책 & 안전 (5/15건)

Community 2026-09-21

Import AI 473: 미국의 초지능 전략; 쥐 해골 속 인간 뇌; 그리고 기계 해석학

AI가 우리와 함께 있는 방에서 부딪히는 벽은 무엇일까요?

Import AI (Jack Clark)
News 2026-09-19

AI 안전 대화가 믿을 수 없을 정도로 발전했다

이번 주 AI 안전에 대한 두 건의 대화가 바이럴되면서 AI의 사실과 허구를 구별하는 것이 얼마나 어려운지를 보여주었습니다.

안전
TechCrunch AI
News 2026-09-19

AI가 인류를 멸망시키지 않으려면 독점 금지 면제가 필요한가?

오늘 Decoder에서는 비즈니스 미래에 대한 2부작 시리즈의 첫 번째 편으로, 조나단 칸터 전 미국 법무부 독점 금지 책임자와 대담을 나눈다. 그는 현재 워싱턴 대학교의 법학 교수이자 카네기 멜런 대학교의 기술 정책 교수로 재직 중이다.

규제
The Verge AI
Community 2026-09-18

[논문] 문자열론적 시퀀스 예측 III

초록: 이전 논문(Kosoy 2026a,b)에서 우리는 문자열론적 단어 복잡성 측정을 적용한 시퀀스 예측 알고리즘 연구를 시작했습니다. 특히, 우리는 복잡성에 대해 다항 시간 예측 알고리즘을 허용하는 산술 반복 복잡성(ARC)이라는 복잡성 측정을 정의했습니다. 여기서 우리는 특히 효율적인 예측 알고리즘을 허용하는 ARC와 관련된 더 약한 복잡성 측정을 보여줍니다: 쿼시선형으로 실행되는 알고리즘

연구
Alignment Forum
Community 2026-09-16

OpenAI, 6건의 새로운 AI 안전 사고 공개

해커 뉴스 (6점, 0 댓글)

OpenAI안전
Hacker News · 6점 · 댓글 0

🎥 영상 & 튜토리얼 (4/11건)

YouTube 2026-09-21

이 로봇은 악마처럼 보입니다... 의도적으로?

이 로봇은 마치 판타지 영화의 악당처럼 보이지만, 의도적으로 그렇게 디자인되었습니다. 겉모습과는 달리 Threehalves 로봇의 디자인은 실제로 완벽하게 말이 됩니다. 네 개의 다리는 안정성을 제공하고, 도구는 손목에 직접 부착되며, 뿔에는 원격 운영자를 위한 카메라가 장착되어 있습니다. 목표는 숙련된 작업자가 산불 지역, 무너진 건물, 유독성 환경과 같은 위험한 작업을 안전한 거리에서 수행할 수 있도록 하는 것입니다. 아직 반쯤 만들어진 개념 증명 단계입니다. 하지만 이것은...

로봇
Matt Wolfe AI
YouTube 2026-09-18

DeepSeek의 엄청난 새 아키텍처

❤️ Lambda를 여기서 확인하고 GPU 클라우드에 가입하세요: https://lambda.ai/papers 📝 DeepSeek V4.1 Flash 논문은 여기서 확인할 수 있습니다: https://www.deepseek.com/en/news/deepseek-v4-1-flash/ 정오표: 3:23의 Opus 5.1 레이블은 Opus 5여야 합니다. 죄송합니다! 출처: https://x.com/flowith/status/2099446892174406055/video/1 https://x.com/loktar00/status/20977

DeepSeek비전연구
Two Minute Papers
YouTube 2026-09-17

Google이 인공지능 폭발을 시작했는가?

https://www.blacksmith.sh/에서 GitHub Actions를 2배 더 빠르게 실행하고 Codesmith로 빌드하세요. Google DeepMind는 방금 AI의 이전 발견 로그를 시뮬레이터로 변환하여 수천 가지 탐색 전략을 테스트할 수 있는 기술인 Dream-RSI를 발표했습니다. 하지만 이것이 실제로 RSI인가요, 아니면 캐싱이 있는 검색 알고리즘인가요? 자세히 알아보겠습니다. #coding #programming Fireship 더 보기? 🗞️ 뉴스레터: https://bytes.dev 🧠 코스: https:

Google코딩
Fireship
YouTube 2026-09-16

AI 연구자들이 'AI 속도 조절' 요구 전에 본 것

왜 지난 며칠 동안 프론티어 AI의 속도를 조절하라는 요구가 그렇게 크게 울려 퍼졌을까요? 안전 경고와 연구소 리더들의 메시지 말입니다. 연구자들이 살펴보고 있는 여섯 가지 축, 사건 보고서 및 추세를 탐색하여 두 주 이상 세계 헤드라인을 장악한 것이 무엇인지 더 잘 파악해 봅시다... AI Insiders ($9!): https://www.patreon.com/AIExplained 챕터: 00:00 - 소개 0:00 - 바이럴이 된 경고 4:23 - 연구자들이 본 여섯 가지 축

연구안전
AI Explained